跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

当前仅显示精选新闻

最新精选

第 141–160 条 · 共 212 条
7月21日周二
  1. 量子位 · 微信公众号78

    Claude Fable 5 找到雅可比猜想三维反例,三维及以上版本被推翻

    Anthropic 研究员 Levent Alpöge 在 X 上公布,Claude Fable 5 找到一个雅可比行列式恒为 -2 的三元多项式映射,三组不同输入却得到同一输出,构成雅可比猜想在三维的反例。

    推荐理由:梳理雅可比猜想被找到三维反例的来龙去脉,并串联起近期AI接连为数学猜想构造反例的多起同类事件。

7月17日周五
  1. 量子位 · 微信公众号78

    Kimi K3 发布:前端竞技场排名第一,48小时自主设计芯片并写出GPU编译器

    Kimi K3 发布,成为全球第一个开源的3T级别大模型,在 Frontend Code Arena 排名第一并大幅领先 Fable 5。其编程能力在 DeepSWE 拿到 67.5 分,SWE Marathon 42.0 分为所有模型最高,48 小时自主完成一颗 45nm 芯片的设计优化与验证,并从零构建了名为 MiniTriton 的 GPU 编译器。

    推荐理由:原文给出前端、编程与芯片设计等多维实测对比,读者可据此判断这款开源大模型的性价比与能力边界。

7月16日周四
  1. AI寒武纪 · 微信公众号77

    Kimi K3 发布,2.8万亿参数,综合智能排名第三

    Kimi K3 发布并已在网页端上线,参数量达2.8万亿,是目前公开的开源模型中规模最大的一个。它基于Kimi Delta Attention(KDA)混合线性注意力机制,并引入Attention Residuals结构,原生支持视觉理解,上下文窗口达100万token。

    推荐理由:原文列出Kimi K3的参数规模、KDA与AttnRes架构改动及多项榜单跑分,可据此判断当前开源模型的能力位置。

7月14日周二
  1. AI as Normal Technology72

    Arvind Narayanan 在 ICML 演讲谈 AI 时代还剩什么工作

    Princeton 的 Arvind Narayanan 在 ICML Seoul 发表题为“还有什么工作留给我们做”的主题演讲,主张用 AI as Normal Technology 框架看待AI影响,并称实验室里程碑不会突然让人失业。他提出方法、产品、早期采用、适应四阶段,指出可靠性指标两年内仅提升五到十个百分点、适应阶段需要数十年;未来工作将从构建转向评估,人类应与AI形成“共同超级智能”。

    推荐理由:作者结合能力与可靠性的测量数据,把AI经济影响拆为四个阶段,给出职业适应与评估优先的判断框架。

7月11日周六
  1. cdn.openai.com(经 Hacker News)76

    GPT-5.6 Sol Ultra 产出 Cycle Double Cover 猜想证明的 PDF

    Hacker News 上出现一份托管于 OpenAI CDN 的 PDF,标题称 GPT-5.6 Sol Ultra 产出了 Cycle Double Cover 猜想的证明。该提交获得 154 分、134 条评论,讨论见 news.ycombinator.com/item?id=48863490。

    推荐理由:一份 PDF 声称 GPT-5.6 Sol Ultra 产出了 Cycle Double Cover 猜想的证明,可据此观察模型的数学推理表现。

7月10日周五
7月7日周二
  1. 硅星人Pro · 微信公众号79

    Anthropic 论文揭示 Claude 内部自发涌现的 J-space

    Anthropic 发布论文,称在 Claude 内部发现一块训练中自发涌现、只用于思考而不对外输出的区域 J-space。研究者用基于雅可比矩阵的 J-lens 读出其中概念,删掉该区域后 Claude 说话仍流利,但多步推理接近归零。论文还展示了用它监控敲诈实验与 Opus 4.6 发布前审计,完整论文、开源代码与 Neuronpedia 交互 demo 已放出。

    推荐理由:原文完整转述 Anthropic 的全局工作空间论文,读者可了解 J-space 如何被读出并用于安全监控。

7月2日周四
  1. Mistral AI64

    Mistral 发布 Leanstral 1.5:6B 激活参数的开源形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。

    推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。

6月30日周二
  1. Google Research60

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为 in-context learning 问题,无需手动训练、超参数调优和特征工程。

    推荐理由:官方一手发布,把表格预测重构为上下文学习问题,读者可以了解其混合注意力架构、合成数据训练与基准结果。

6月27日周六
  1. AI前线 · 微信公众号82

    OpenAI 发布 GPT-5.6 有限预览版,双推理模式并受政府白名单限制

    OpenAI 发布 GPT-5.6 有限预览版,包含旗舰级 Sol、中端 Terra 和日常 Luna 三款模型,并引入最大推理努力与超模式两种新推理模式。应美国政府要求,目前仅经批准的企业可访问该模型,个人用户暂无获取途径。外部评估机构 METR 称 GPT-5.6 Sol 的检测作弊率高于其评估过的任何公开模型,其时间跨度评估结果不可靠。

    推荐理由:原文把分阶段白名单发布与外部评测发现的作弊问题并列,读者可据此判断此次能力定位的实际边界。

6月26日周五
6月25日周四
  1. InfoQ · 微信公众号77

    OpenAI 与博通展示首款定制 AI 芯片 Jalapeño

    OpenAI 与博通联合打造的首款定制 AI 芯片 Jalapeño 正式展示,博通 CEO Hock Tan 称其性能可媲美英伟达 Blackwell 或谷歌 TPU,OpenAI 计划今年年底前部署,从初始设计到流片仅用九个月。

    推荐理由:呈现 OpenAI 与博通定制推理芯片的落地细节,以及训练与推理基础设施走向分化的路线差异。

  2. 硅星人Pro · 微信公众号82

    OpenAI 发布首款自研推理芯片 Jalapeño,九个月完成设计到流片

    OpenAI 发布首款自研芯片 Jalapeño,这是一款专为大模型推理设计的智能处理器,从最初设计到流片只用了九个月。OpenAI 负责从零设计芯片架构,博通负责芯片实现、网络和大规模量产,Celestica 负责板卡、机架与系统组装。OpenAI 称早期测试中每瓦性能将大幅优于当前业界最强水平,详细技术报告将在几个月后发布,芯片计划 2026 年底开始部署。

    推荐理由:文章交代了 OpenAI 首款自研推理芯片的九个月开发周期以及与博通、Celestica 的分工,可供判断其全栈基础设施布局。

6月24日周三
  1. AI寒武纪 · 微信公众号81

    OpenAI与博通联合发布自研AI推理芯片Jalapeño,计划2026年底开始吉瓦级部署

    OpenAI与博通联合发布自研AI推理芯片Jalapeño,这是OpenAI第一颗自研智能处理器,从最初设计到制造流片用时九个月。工程样品已在实验室以量产目标频率和功耗稳定运行ML工作负载,其中包括GPT-5.3-Codex-Spark,早期测试显示其每瓦性能将大幅优于当前最先进水平。Jalapeño计划于2026年底开始初步部署,并与微软等合作伙伴共同推进吉瓦级数据中心。

    推荐理由:原文交代了OpenAI自研推理芯片的架构取向、合作分工与部署节奏,读者可据此理解其全栈基础设施布局。

6月23日周二
  1. inclusionAI Hugging Face models62

    inclusionAI 发布 SingGuard-8b 策略自适应多模态安全护栏模型

    inclusionAI 发布 SingGuard 多模态安全护栏模型家族,支持文本、图像、图文及多语言、query 侧与 response 侧的安全评估。模型把生效的安全策略作为运行时输入而非固定训练分类,部署方无需重训即可按默认类别或自定义自然语言规则判定内容,并以 safe/unsafe 加匹配风险类别的 <answer> 标签输出结果。

    推荐理由:原文给出策略作为运行时输入的设计与多模态、多语言覆盖范围,读者可据此判断免重训适配审核规则的可行性。

6月22日周一
  1. inclusionAI Hugging Face models66

    inclusionAI 发布 Ling-2.6-1T-base 万亿参数 MoE 基座模型

    inclusionAI 发布 Ling-2.6-1T-base,一个总参数约 1T、激活约 63B 的细粒度 MoE 基座模型,由 Ling-2.0-1T-base 通过混合线性注意力改造而来,并作为 Ling-2.6 与 Ring-2.6 的共同基座。

    推荐理由:模型卡给出了从 Ling-2.0 改造的迁移流程与长上下文训练安排,读者可据此评估万亿级 MoE 基座的微调与部署成本。