评测 agent 的基准大多长在程序员的地界上:修 bug、刷题、逛网页。 法律 AI 公司 Harvey 把自家的评测开源了出来—— Harvey LAB (Legal Agent Benchmark), 让 agent 坐进虚拟资料室里干真实的律师活:尽调、起草、红线、备忘录。 任务怎么造、环境怎么隔离、没有标准答案怎么判分,这套设计值得拆开看看。 定位 MIT 协议的开源基准,两部分:一个任…
评测 agent 的基准大多长在程序员的地界上:修 bug、刷题、逛网页。 法律 AI 公司 Harvey 把自家的评测开源了出来—— Harvey LAB (Legal Agent Benchmark), 让 agent 坐进虚拟资料室里干真实的律师活:尽调、起草、红线、备忘录。 任务怎么造、环境怎么隔离、没有标准答案怎么判分,这套设计值得拆开看看。 定位 MIT 协议的开源基准,两部分:一个任…
讨论
登录后参与讨论
还没有评论,来说第一句吧。