
平时看你口若悬河、写诗作曲的AI,能帮你排好下周的会议时间吗?能在一场物流高峰里,调度20辆货车避开拥堵吗?结果往往是“看起来都对了,但细看全乱了”。腾讯混元团队和中国人民大学高瓴人工智能学院最近开源了一个叫PlanningBench的框架,专门用来测一测大模型到底有没有真本事——做计划。
这个框架不是让AI答题,而是给它“真实世界的任务”。比如排日程、分资源、排班、调度车辆、安排生产线,甚至应急服务响应。总计超过30种任务类型,覆盖六大类实际场景。设计者特意避免让模型“刷题”——只在一个领域反复练,而是要它跑来跑去,应对五花八门的现实需求。
更狠的是,PlanningBench会控制“难度”。它不靠把题目变长来折腾AI,而是拆解任务结构、约束条件和资源紧张度。比如让AI安排3个人轮班30天,比安排10个人轮班10天难得多。每条测试数据还附带一张checklist,检查AI的输出是否满足输入条件、有没有超资源、目标是不是最优。
它还能识别一种“骗人”的情况:计划看起来大部分正确,但整体根本不可行。比如同时安排两个会议在同一个房间,每个会议描述都对,合起来就废了。这种局部合规、全局失败的漏洞,正是AI规划能力的软肋。
研究团队用PlanningBench生成的数据去训练模型,结果模型在没见过的规划任务甚至通用任务上表现都提高了。这说明,这个框架提供的学习信号是通用、可迁移的,不是死记硬背。
一句话总结:PlanningBench让AI从“会说话”走向“会做事”。以后你想让AI帮你搞定一趟自驾游路线,或者规划一周的采购清单,它可能真能给出靠谱答案。而对于开发者来说,有了这个开源框架,训练一个“懂规划的AI”不再是盲人摸象。
精选评论
评论加载中…