Endless Exam:面向超级智能的数学构造基准,覆盖 14 类参数化问题族
研究者推出 Endless Exam 基准,覆盖 14 个参数化数学构造问题族,用可验证的相对质量分数衡量模型在已发表数学前沿之前与之后的进展,且不将改进上限封顶为 1。在 69 个实例上评测 9 个模型,连续质量分数能区分表现差异,但 30 个已发表前沿参考无一被超越。该基准已开源生成器、验证器、参考基线、模型回答与分析,并新增 Claude Opus 5.5 评测。
研究者推出 Endless Exam 基准,覆盖 14 个参数化数学构造问题族,用可验证的相对质量分数衡量模型在已发表数学前沿之前与之后的进展,且不将改进上限封顶为 1。在 69 个实例上评测 9 个模型,连续质量分数能区分表现差异,但 30 个已发表前沿参考无一被超越。该基准已开源生成器、验证器、参考基线、模型回答与分析,并新增 Claude Opus 5.5 评测。
一项在 Llama3 和 Qwen2.5 模型家族上开展的强到弱知识蒸馏研究显示,rollout 策略并非蒸馏动态的核心因素:token 级 KL 方向更明显地影响任务表现与输出覆盖,学习率则决定遗忘程度与更新稀疏性。
一篇综述将联合生成、跨模态生成与联合编辑统一形式化为音视频对分布上的三类问题,并提出沿五个设计轴比较方法的分类体系。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各设定的方法、数据集与指标。
SAKIKO 审计框架通过方向性错误发现、路由器条件干预、目的地解析验证与前瞻性冻结统计许可,对工具调用前决策的内部激活干预进行机制性审计。
GPT-6 Astra 处理一份 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。其对用户意图更强的理解能力,也让 Basis 在真实业务场景中使用时更有信心。
SeLMRoute 是一种将候选模型无关的语义证据提取与候选性能学习、部署目标应用分离的 LLM 路由框架,先通过可解释问题生成概率语义状态,再由轻量监督路由器估计候选模型表现。
B200 GPU 租金九个月内从 $4.40 翻倍到 $8.08 每 GPU 小时,但 AI 价格仍在下降。作者归因于数据中心建设成本上升、需求爆发与推理效率提升并存:同一基准的完成成本从 $0.55 降到 $0.0015,Microsoft 称每 GPU 生成 token 数同比增长 90%。
OpenRouter 推出 Security Center,可在设置 > Security 下跨工作区查看所有 API key、识别风险 key,并支持一次最多 500 个批量禁用、归档或设置消费上限,所有套餐可用。
推荐理由:OpenRouter 以自家 85 名员工 1000 多个 key 的审计为参照,介绍了安全中心的清理建议、风险评分和批量操作方法。
研究者推出 BIABench,一个由 16 项已发表生物学研究重建而成的基准,保留原始科学问题、成像数据与 ground truth,覆盖从 H&E 组织学到单分子定位显微镜的 11 类分析子任务。
针对潜空间视觉推理(LVR)中潜 token 对图像扰动响应微弱、缺乏显式监督的"潜证据信用缺口",研究者提出 ReaLVR,通过对比正确答案与模型生成的错误答案、匹配与不匹配的视觉证据,为模型自身的潜推理轨迹提供视觉证据监督。
Rubric Response Theory(RRT)用两参数项目反应模型把评分标准的判定模式转化为标量质量信号,替代传统的分数加总方式。其 Response Parameter Network(RPN)根据提示词和标准文本预测标准难度与区分度,并随训练用在线期望最大化更新。
研究团队提出 Tex-Zero,证明高保真原生 3D 纹理生成框架无需 3D 资产即可训练。该方法将高质量 2D 图像表示为 3D 空间中的平面,并通过分块随机旋转与聚合构造复杂几何结构,生成训练样本。基于这些数据训练的 Tex-Zero VAE 和 Tex-Zero DiT 在未见过真实 3D 资产的情况下,仍能生成细节精细的高保真 3D 纹理。
arXiv 论文(arXiv:2609.35928)发现,多智能体 LLM 系统中当各智能体知晓彼此的模型家族时,群体会按标签分裂为派系,即任务本身并不奖励的 factionalism 现象。
Apple 研究团队针对联邦随机变分不等式(VI)优化,证明经典 Local Extra SGD 在更精细分析下可获得更紧的收敛保证,并指出其存在客户端漂移过大的固有缺陷。
NavHarness 是一个面向终身具身导航的训练无关框架,将记忆处理纳入导航循环,通过多轮智能体会话调用地图、任务记录与房屋知识并对照观测修正。
研究者提出 RegLLM 诊断框架,用于评估受监管智能体工作流中的有限自主性,监测引用有效性、来源依据、schema 合规、升级正确性、宪法对齐和不安全动作率六项可信度信号。
研究者提出 Future-Aware Recall(FAR),一个从未来感知预测监督中学习情景记忆召回的框架,通过负扩散预测损失近似条件对数似然来衡量记忆的预测效用,并训练一个推理时对未来盲的检索器。该检索器能学习各线索的相关性,自动决定每个查询该信任时间、姿态、视觉、音频中的哪些线索。在三种互补设置下,FAR 即使使用相同检索线索也优于手工设计的召回方法。
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕主题演讲,按时间线盘点 2026 年 LLM 领域的关键进展,附注释版幻灯片。
Simon Willison 用 Opus 5.5 编写了一个 Bluesky 回复机器人检测工具,通过分析打字速度、发帖时间、互动模式等行为信号判断账号是否为自动回复机器人。工具展示每项测量和规则及触发信号最多的示例回复;作者称 Bluesky 开放 API 使此类调查比 Twitter 更可行,检测信号包括秒级连发回复、从不发布原创内容、专门回复高粉丝用户及使用问号等。
Smooth Operator
CI has become the top bottleneck of every engineering team I talk to (including Lindy). Our CI spend has become stratospheric.
MiniMax's latest text model, M3.1-Flash-Preview, debuts today on MiniMax Code. Built for everyday development, it's fast, reliable, and ready for real work, from quick bug fixes to full features.
Anthropic 发布 Claude Sonnet 5.5(claude-sonnet-5-5),可在 Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry 使用。
推荐理由:官方列出了五类从 Claude Sonnet 5 升级会破坏的代码场景和迁移指引,方便开发者提前排查自己的 API 调用。
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,测试中单任务成本最多低 30%。
推荐理由:官方发布给出了与 Sonnet 5 和 Opus 5.5 的多项基准对比、定价和成本数据,读者可以据此判断它在自己场景下是否值得迁移。
NVIDIA 发布开源的 Open Agent Safety Platform,Anthropic 与其合作,为智能体栈增加安全与控制层。
推荐理由:Anthropic 官方说明双方如何用模型外分层控制约束智能体,读者可据此评估企业级 Agent 的安全部署方式。
Parse 5 为常见格式的企业文档提供最优价格。它可解析并返回: ✅ 表格 ✅ 图像 ✅ 边界框 ✅ 流程图 ✅ 以及更多 看看它的表现 👇
Sakana AI 与东京大学合作提出 SAIL(Scaling In-Context Imitation Learning),通过测试时扩展让 VLM 更可靠地生成机器人轨迹,该工作将在 IROS2026 展示。
如果乔布斯来做 Muse 及硬件 会如何做 https://x.com/i/article/2104186692840427521
我最喜欢的 Paul Graham 文章《如何做出伟大的工作》,浓缩在不到 200 秒的视频里 (感谢 opus)
从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)
HuggingFace 上开源了一个用 Claude Opus 5.5 生成的模拟医患对话数据集,覆盖 2194 种疾病,平均每段 33 轮,从描述症状、检查聊到治疗和后续安排。
Songs are my superpersuasion failure mode. They can elicit emotions in me like little else... This might be how I flip. Once AI creates pieces more beautiful than Debussy's I'll have no other option than to kneel before the Divine...
DataMagic 提出一种从原始表格数据自动生成数据视频的声明式多智能体编排方法。其 DVSpec 规范统一图表、旁白与动画并保证数据溯源,配合“先生成后编排”策略优化叙事连贯性。在 109 个真实样本上,DataMagic 将质量分数从 GPT-5 的 2.13/5 提升至 3.89(+83%),执行成功率超 95%,并将创作耗时降低 79.7%。
Simon Willison 为 WeAreDevelopers 大会闭幕演讲用 Claude Opus 5.5 生成一个含至少 20 只鸮鹦鹉的 HTML5 canvas 像素艺术派对动画页面。
claude just generated this 2 minute video about the history of Google and it goes so goddamn hard