claudeers.

Projects tagged #agent-evaluation

// agent-evaluation (1)

🔓

Evaluate & benchmark AI coding agents and Claude Code skills — sandboxed, reproducible YAML eval suites for Claude Code, Codex & Gemini, with A/B experiments…

// skillsUiPath/Python113Apache-2.0[ claude ]