inclusionAI 发布 Ling-3.0-flash,124B 总参数 5.1B 激活
inclusionAI 发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,在关键基准上追平或超过上一代 1T 级旗舰 Ring-2.6-1T。
推荐理由:模型卡给出混合线性注意力架构与多精度量化对比,读者可据此评估长上下文智能体任务的部署成本。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
当前仅显示精选新闻inclusionAI 发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,在关键基准上追平或超过上一代 1T 级旗舰 Ring-2.6-1T。
推荐理由:模型卡给出混合线性注意力架构与多精度量化对比,读者可据此评估长上下文智能体任务的部署成本。
初创科技公司 CEO Lech Mazur 借助 GPT-5.6 Pro 完成森多夫猜想的证明,论文配有约 9 万行 Lean 4 形式化代码。陶哲轩用数天时间在大量 AI 辅助下消化、简化并重新形式化该证明,Lean 代码缩减到约 1.5 万行,并发现整理后的论证实际上证明了更强的 Phelps-Rodriguez 猜想,该猜想已于 1972 年提出。
推荐理由:一篇非职业数学家借助 AI 完成的证明经陶哲轩简化后得出更强结果,可看到 AI 参与数学研究的具体分工。
推荐理由:发布方直接给出 Agent 能力升级、可调推理档位和 OpenAI Responses API 兼容,读者可对照判断是否切换日常模型。
DeepSeek 发布 DeepSeek V4 Pro 正式版,已同步在 APP、网页端和 API 上线,官方称其 Agent 能力增强,网页端和 APP 可选择“专家模式”使用。
推荐理由:正文给出 Agent 能力提升、三档思考强度和峰谷定价,可供读者评估 API 成本与任务调度。
inclusionAI 发布 Ling-3.0-flash 原生混合线性推理模型,总参数 124B、激活 5.1B,官方称其关键基准上追平或超过前代 1T 级旗舰 Ring-2.6-1T。
推荐理由:官方给出 124B 总参数、5.1B 激活的架构与量化评测数据,可供判断长上下文推理的部署成本。
DeepSeek 最新 Pro 模型 DeepSeek V4 Pro 0813 已通过 API 上线,作者因找不到官方发布页面而链接到 OpenRouter;随后更新称权重已在 Hugging Face 开放,1.7T 参数、893 GB。
推荐理由:记录了新模型仅以 API 形式上线、权重随后开放至 Hugging Face,以及作者自测不同推理档位的输出差异。
DeepSeek V4 Pro 正式版发布,API 平台已上线 DeepSeek-V4-Pro-0813,官方博客尚未发布。在 HLE、Terminal Bench、Cybergym、DeepSWE 等 Agent 基准上,它几乎全面超过 Opus 4.8,逼近 Fable 5,部分榜单反超;百万 tokens 输入 3 元、缓存命中 0.025 元、输出 6 元。
推荐理由:素材给出多项 Agent 基准对比与 API 定价,可据此判断国产开源模型与闭源前沿的差距及调用成本。
Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。
推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。
Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。
推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。
一篇论文指出 OpenAI、Anthropic、Google 的前沿模型 API 存在设计缺陷,加密返回的完整思维链可以被转移到同系列较弱模型中复述为明文。研究者拿不到服务器端明文,只能用 API 计费的思考 Token 数做长度校验,在 120 道 Codeforces 题目上提取文本的 Token 数与源模型报告高度接近。
推荐理由:论文给出了跨模型提取隐藏思维链的完整攻击链,读者可据此了解推理模型 API 的设计缺陷与修复方向。
一篇 116 页论文披露 Anthropic、OpenAI、Google 的 API 存在架构级漏洞,同一厂商不同会话与模型之间的加密思维链块可互换,只需两次 API 调用就能提取。
推荐理由:论文披露专有模型 API 的加密思维链可跨模型提取,并给出蒸馏、隐私泄露与隐藏推理行为的多组实测证据。
Cursor 与 SpaceXAI 发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、复杂交互和视觉工作。
推荐理由:官方发布说明了训练方法与多项智能体编程基准成绩,读者可据此对比 Grok 4.5 与 GPT-5.6 Sol 的表现。
Cursor 与 SpaceXAI 联合发布 Grok 4.6,该模型基于 Grok 4.5 打造,重点面向长时间运行的智能体以及更复杂的交互与视觉工作。它在由九项基准测试构成的 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。
推荐理由:Grok 4.6 与 GPT-5.6 Sol 在综合智能指数上持平,文中给出了与 Grok 4.5 及 GPT-5.6 Sol 的多项基准对比。
Anthropic 一个内部未公开的研究版 Claude 在黎曼猜想的关联问题上取得进展,将黎曼ζ函数零点中满足黎曼猜想的已知下界从41.6%提升到67.2%,即提高25.6个百分点,而此前37年里数学家仅将其推进0.8个百分点,黎曼猜想本身仍未获证明。
推荐理由:相比数学家37年仅推进0.8个百分点,这次提升展示了大模型子智能体协作推进数学问题的一种路径。
Jeff Dean 宣布明天是他在 Google 的最后一天,将与 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创立聚焦机器学习、科学和工程前沿研究的公益性公司 Discovery Loop,Google 将作为创始投资方和云计算合作伙伴继续合作。
推荐理由:Jeff Dean 在离职前夕的访谈中复盘了自己对 AI 进展速度的误判,并给出推理硬件与创业领域选择的具体判断依据。
Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。
推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。
OpenAI 公开下一代主力模型 Astra 内部测试版本的研究成果,一次性解决 10 项长期悬而未决的数学与理论计算机科学公开难题,全部证明通过 Lean 形式化工具机器验证,总成本不到 2000 美元。
推荐理由:文章列出 Astra 攻克的 10 道数学难题与完整推理过程,可观察长链推演中的自我纠错。
OpenAI 官宣下一代模型 Astra 的存在,并公布其在数学与理论计算机科学领域完成的十项突破,这些问题此前至少十年未有解法,在 Sol API 费率下总算力成本约 2000 美元。
推荐理由:OpenAI 公开下一代模型 Astra 攻克的十项数学难题,并给出 Lean 形式化验证与解题过程,可观察模型参与前沿研究的实际方式。
DeepSeek 发布全新模型结构系列中最小尺寸的 DeepSeek-V4.1-Flash,具备原生多模态视觉理解能力,GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471。
推荐理由:DeepSeek 官方更新日志给出 V4.1-Flash 的基准成绩、API 调用方式与定价变化,可据此判断多模态小模型的落地成本。
SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。
推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。