agent as a judge这个框架本身是用来评估代码生成agent的效果的,并且提出了名为DevAI的测试集,用来评测AI开发任务的效果 https://deepwiki.com/metauto-ai/agent-as-a-judge/2-usage-guide 现成的codebase中,主要有3个feature可以用: * ask anything * 用自然语言去query codebase * agent evaluation * 使用AaaJ来评估developer agent的效果。这里有两种方式,…