
测试成绩从30%飙到90%只用了10个月,一个评测基准就这样被“刷爆”了。7月17日,美团LongCat扔出了一块更硬的试金石——LoHoSearch,让搜索智能体集体跌回30%出头。这个新基准的题目不是人写的,而是从一个涵盖762万个实体的维基百科知识图谱里自动生成的。过去的基准靠人脑出题,再难也有天花板;LoHoSearch把出题权交给图谱,难度天花板被彻底掀开。结果相当刺眼:在11个前沿模型的测试中,最佳成绩只有34.74%,紧随其后的三个模型集中在15%到16%左右;而同一批顶尖模型在旧基准BrowseComp上眼下能拿到约90%的分数。差距之大,直观说明LoHoSearch把搜索智能体真正的短板暴露了出来。更有意思的是上下文策略的边际效用:在LoHoSearch上,最好的上下文策略只带来6.8个百分点的提升,而同样的操作在BrowseComp上能换回14个百分点——这意味着靠提示和上下文工程去补能力的老办法,在这套新基准里几乎失灵。这套基准本身有544道问题,覆盖11个领域,问题采用树状与图结构组织,并且已经开源。当老基准被刷到顶、搜索agent的真正挑战才刚开始,LoHoSearch很可能成为下一个绕不开的必测项。
精选评论
评论加载中…