An evaluation harness for Agent Skills that runs declarative cases across engines, judges results, and drives iterative skill improvement.