跳到正文
@berryxia· @berryxia · X·· 2026-06-05AI 评分58
AI 导读

腾讯混元联合中国人民大学高瓴人工智能学院开源 PlanningBench,一个用于评测和训练 LLM 规划能力的可验证框架,包含 30 多个真实世界规划任务,覆盖调度、生产、旅行、资源分配、应急响应等六大类。每个任务都有明确成功标准和全自动验证机制,并同时支持评测与训练微调。论文、代码和数据集已发布在 arXiv、GitHub 和 Hugging Face。

正文

大模型都不再卷推理,都开始卷规划能力!

腾讯混元联合人大高瓴人工智能学院直接开源了PlanningBench,一个专门测、训LLM真实规划能力的框架。

里面塞了30多个来自真实世界的规划任务,覆盖调度、生产、旅行、资源分配、应急响应等六大类,每一个都有清晰的成功标准和全自动验证机制。

你既可以用它测出当前最强模型到底在规划上有多拉胯,也能直接拿来继续微调,让模型从“会说”真正进化到“会干”。

以前整个行业都在卷参数、卷上下文、卷工具调用,好像规划能力是自然就会长出来的。

现在PlanningBench用30多个可验证任务直接把真相摊开:规划才是agent从玩具走向生产力的真正分水岭。

腾讯这次把论文、代码、数据集全甩到GitHub和Hugging Face,等于把这个最难、最核心的能力从黑盒拉到了公开赛道。

引用Tencent Hy (@TencentHunyuan)@TencentHunyuan
Planning is where LLMs move from “saying” to “doing.” Tencent Hy, in collaboration with the Gaoling School of Artificial Intelligence at Renmin University of China, is excited to open-source PlanningBench - a scalable, verifiable framework for evaluating and training LLM planning capabilities. With PlanningBench, you get: ✅ 30+ real-world planning tasks ✅ Automated verification ✅ Evaluation and training support See how top-tier LLMs perform on PlanningBench 👇 Resources: arXiv: arxiv.org/abs/2605.20873 GitHub: github.com/Tencent-Hunyuan/P… HuggingFace: huggingface.co/datasets/tenc… #PlanningBench #TencentHunyuan #OpenSource 📷
在 X 查看被引用的帖子

来源:@berryxia · x.com