跳到正文
@OpenBMB· @OpenBMB · X·· 26 天前精选AI 评分68
AI 导读

面壁智能 OpenBMB 发布 UltraData 系列开源训练数据,包括 UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609 和函数调用式数据精炼方案 UltraX,用于支撑 MiniCPM5-2B。

推荐理由

原文列出 UltraData 各数据集的规模与覆盖范围,可据此判断这批开源训练数据的复用价值。

正文

A strong model starts with strong data.

Behind MiniCPM5-2B is a growing body of open-source training data from OpenBMB.

The latest releases include UltraData-Code, UltraData-SFT-Agent-2609, UltraData-RL-2609, and UltraX, covering code, agent training, RL, and large-scale data refinement.

🔹 UltraX
A function-calling approach to data refinement, turning fine-grained edits into executable operations. Its open preview contains ~100B tokens across five refined web datasets.

🔹 UltraData-Code
UltraData-Code-L2 (~400B tokens) and UltraData-Code-L3 (~150B tokens) across 11 programming languages.

🔹 UltraData-SFT-Agent-2609
~500K agent training samples spanning Search, Code Agent, General Agent, and tool use, with tasks covering web search, software engineering, multi-turn memory, database interaction, and more.

🔹 UltraData-RL-2609
80K+ RL samples across math, coding, knowledge, and long-context tasks, carefully filtered for verifiability, reward reliability, and difficulty matching.

来源:@OpenBMB · x.com