
AI再聪明,也经常在“做计划”这件事上翻车:让它安排一周的会议,它可能把三个会挤在同一个时间点;让它分配资源,它可能忽略人手不够的问题。现在,腾讯混元团队和中国人民大学高瓴人工智能学院联手,开源了一个叫PlanningBench的框架,专门用来测大模型到底会不会“安排事情”。
这个框架不搞虚的:它从真实场景出发,抽象出任务、约束和难度,一口气覆盖了30多种规划任务类型——日程排布、资源分配、人力排班、路径调度、生产运营、应急服务,全都有。举个例子,你可以给它一个“三天内完成五台机器检修,同时要应付两场突发故障”的任务,看它能不能排出合理的顺序。
更重要的是,PlanningBench每一条数据都配了一张“检查清单”:有没有满足输入条件?资源限制遵守了吗?目标是不是最优?更厉害的是,它还能识别出那种“看起来大部分对了,但整体根本执行不了”的方案——比如AI列了个行程,每个步骤单独看都对,但合起来就变成了死循环。
测试结果也很有意思:用PlanningBench的可验证数据训练过的模型,即使碰到没见过的规划任务,表现也明显提升。说明这个框架不只在“刷题”,而是真的教模型学会了怎么“动脑子做计划”。
一句话总结:过去AI只会“说”,现在腾讯和人大想让AI学会“做”。这个开源框架,就像给大模型上了一堂“逻辑思维训练课”——能不能毕业,就看它会不会排日程了。
精选评论
评论加载中…