字节 Seed 论文提出 Chain-of-Experience:让 LLM 在测试时从经验中持续改进
字节 Seed 论文提出 Chain-of-Experience(CoE),让 LLM 在测试时通过迭代交互积累经验痕迹,形成超越零样本推理的持续改进循环。研究在数学、编程和知识任务上评测 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet 等 8 个模型,仅靠自我反馈即可带来 5.6% 的整体提升,并将 API 成本降低 19%。
seed.bytedance.com · 网站与博客
字节 Seed 论文提出 Chain-of-Experience(CoE),让 LLM 在测试时通过迭代交互积累经验痕迹,形成超越零样本推理的持续改进循环。研究在数学、编程和知识任务上评测 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet 等 8 个模型,仅靠自我反馈即可带来 5.6% 的整体提升,并将 API 成本降低 19%。
ByteDance Seed 提出 Harness-IF,从执行证据逐条给操作规则打分,覆盖 60 个多轮编码任务、256 条规则,分布在部署智能体可读取的五个可配置指令面上。
字节跳动 Seed 提出 GST-Bench,一个面向视频全局空间智能的 VQA 基准,题目由 6790 分钟合成视频生成并经人工核验,要求模型从视频中未出现的新视角做空间推理,并将第一人称观测映射到全局俯视图。
字节 Seed 提出 Experience Distillation,可将 AI 智能体的交互历史蒸馏进模型权重,且无需额外环境交互。在 749 个软件工程任务和 6 款文字冒险游戏上,该方法保留至少 64.8% 的上下文学习收益,而直接监督微调仅恢复 3.8%。结合上下文学习,它以至少 9.6 倍更少的环境样本追平经典强化学习基线。
ByteDance Seed 团队发布 EdgeBench,一套包含 134 个真实世界超长时程任务的评测套件,并基于约 38,000 小时的 Agent 环境交互分析。
ByteDance Seed 提出 MSQA,一个原生采集的多语言多文化基准,含 11 个语系、5 个文化维度、3 个难度层级的 1064 道题,用于检验"会说某语言就懂其文化"的"文化对齐幻觉"。
字节跳动 Seed 发布 Seed2.0 模型系列,针对长尾知识与复杂指令遵循两大难题,提升模型在复杂长程任务上的可靠性。该系列在推理、视觉理解与搜索能力上达到世界领先水平,并已开始展现处理初步真实世界复杂任务的能力。
字节提出端到端框架 ByteCRN,用生成式 rectified flow 架构同时完成过渡态生成与反应验证,替代传统工作流中最昂贵的过渡态搜索和 IRC 验证步骤。该框架相比传统工作流提速 10–100 倍,并在网络尺度上剪除约 70–90% 的枚举反应。ByteCRN 已用于发现涉及 cyanoacetaldehyde 的新路径,并成功建模 γ-ketohydroperoxide 网络。