AI 导读
腾讯混元联合中国人民大学高瓴人工智能学院开源 PlanningBench,一个用于评测和训练 LLM 规划能力的可验证框架,包含 30 多个真实世界规划任务,覆盖调度、生产、旅行、资源分配、应急响应等六大类。每个任务都有明确成功标准和全自动验证机制,并同时支持评测与训练微调。论文、代码和数据集已发布在 arXiv、GitHub 和 Hugging Face。
正文
大模型都不再卷推理,都开始卷规划能力!
腾讯混元联合人大高瓴人工智能学院直接开源了PlanningBench,一个专门测、训LLM真实规划能力的框架。
里面塞了30多个来自真实世界的规划任务,覆盖调度、生产、旅行、资源分配、应急响应等六大类,每一个都有清晰的成功标准和全自动验证机制。
你既可以用它测出当前最强模型到底在规划上有多拉胯,也能直接拿来继续微调,让模型从“会说”真正进化到“会干”。
以前整个行业都在卷参数、卷上下文、卷工具调用,好像规划能力是自然就会长出来的。
现在PlanningBench用30多个可验证任务直接把真相摊开:规划才是agent从玩具走向生产力的真正分水岭。
腾讯这次把论文、代码、数据集全甩到GitHub和Hugging Face,等于把这个最难、最核心的能力从黑盒拉到了公开赛道。
Planning is where LLMs move from “saying” to “doing.” Tencent Hy, in collaboration with the Gaoling School of Artificial Intelligence at Renmin University of China, is excited to open-source PlanningBench - a scalable, verifiable framework for evaluating and training LLM planning capabilities. With PlanningBench, you get: ✅ 30+ real-world planning tasks ✅ Automated verification ✅ Evaluation and training support See how top-tier LLMs perform on PlanningBench 👇 Resources: arXiv: arxiv.org/abs/2605.20873 GitHub: github.com/Tencent-Hunyuan/P… HuggingFace: huggingface.co/datasets/tenc… #PlanningBench #TencentHunyuan #OpenSource 📷在 X 查看被引用的帖子
来源:@berryxia · x.com