面壁智能 OpenBMB 发布 UltraData 系列开源训练数据,包括 UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609 和函数调用式数据精炼方案 UltraX,用于支撑 MiniCPM5-2B。
原文列出 UltraData 各数据集的规模与覆盖范围,可据此判断这批开源训练数据的复用价值。
A strong model starts with strong data.
Behind MiniCPM5-2B is a growing body of open-source training data from OpenBMB.
The latest releases include UltraData-Code, UltraData-SFT-Agent-2609, UltraData-RL-2609, and UltraX, covering code, agent training, RL, and large-scale data refinement.
🔹 UltraX
A function-calling approach to data refinement, turning fine-grained edits into executable operations. Its open preview contains ~100B tokens across five refined web datasets.
🔹 UltraData-Code
UltraData-Code-L2 (~400B tokens) and UltraData-Code-L3 (~150B tokens) across 11 programming languages.
🔹 UltraData-SFT-Agent-2609
~500K agent training samples spanning Search, Code Agent, General Agent, and tool use, with tasks covering web search, software engineering, multi-turn memory, database interaction, and more.
🔹 UltraData-RL-2609
80K+ RL samples across math, coding, knowledge, and long-context tasks, carefully filtered for verifiability, reward reliability, and difficulty matching.
来源:@OpenBMB · x.com