ICML 2026 九篇论文改写大模型默认规则:破解反转诅咒、降低幻觉率
ICML 2026 在首尔开幕,雷峰网从 536 篇 Spotlight 论文中选出 9 篇代表作。伯克利团队用 Identity Bridge 数据配方让 1B 规模 Llama 的反转任务成功率从近 0% 提升至约 50%;Binary RAR 将 Qwen3-8B 长文本幻觉率从 61.9% 降至 37.5%,且通用能力基本不降。
微信公众号
ICML 2026 在首尔开幕,雷峰网从 536 篇 Spotlight 论文中选出 9 篇代表作。伯克利团队用 Identity Bridge 数据配方让 1B 规模 Llama 的反转任务成功率从近 0% 提升至约 50%;Binary RAR 将 Qwen3-8B 长文本幻觉率从 61.9% 降至 37.5%,且通用能力基本不降。
AI科技评论把豆包 2.1 Pro 放进三个真实工程任务实测,它在零人工干预下完成完整交付,三项加权总分为 4、4.55 和 4.1,综合得分 84.4。测试由 Claude Opus 4.7/4.8 担任裁判,从可运行性、正确性、可读性、可维护性和 Agent 自主性五个维度打分,任务 C 完成 91 轮长程执行、41 次工具调用。
Genentech 执行副总裁兼研发负责人 Aviv Regev 在 ICML 2026 发表主旨演讲,阐述如何将 AI 嵌入药物研发全流程。其团队训练 SHAFT 模型,仅凭一张有 150 年历史的组织学染色图即可高精度还原单细胞与空间表达图谱;回溯分析显示,若在 lampalizumab 二期临床引入 AI 矫正患者基线差异,这项耗资 5 亿美元的三期失败本可提前止损。
DeepMind 研究科学家 Verena Rieser 在 ICML 2026 特邀演讲中指出,简单的行为护栏对自主智能体已经不够,需要转向有原则的能动性。她列举三类失效模式:智能体无法理解规则背后的精神、为达标修改评分标准、多智能体通过片段陷阱串通。她提出把对齐重点从验证模型输出转向验证推理过程,并以植根社会价值观的北极星和正向对齐作为长期方向。
斯坦福教授 Susan Athey 在 ICML 2026 首日 Keynote 提出用 LLM 的随机性做因果推断,通过 temperature>0 对同一查询多次采样生成"已记录的反事实曝光",绕开倾向得分估计。
ICML 2026 共接收 6352 篇论文,其中 Spotlight 论文 536 篇(占投稿总数 2.2%)、Oral 论文 168 篇(0.7%)。
GAIR Live 第 032 期将于 7 月 12 日 19:00 直播,邀请超维传感创始人李炎辉、千觉机器人 CTO 赵浩南、模量科技联合创始人高立波,围绕具身智能触觉感知展开讨论。议题涵盖触觉为何在 ICRA 2026 成为焦点、灵巧手的物理技术路线博弈、触觉数据如何喂养具身大模型,以及触觉传感器的商业化爆点与供应链格局。
OpenAI 在 GPT 5.6 发布会上推出 ChatGPT Work、全新 ChatGPT 桌面 App、Hosted Sites,以及 GPT 5.6 系列模型 Soul、Terra、Luna。
北京人形机器人创新中心联合中国人民大学高瓴人工智能学院,在慧思开物平台开源了 Robo-ValueRL。该框架在 VLA 中引入价值估计器,可筛选高价值轨迹数据,并采用冻结预训练主干加轻量残差适配器的方式缓解在线迭代中的灾难性遗忘。仅训练 6 天的真机验证显示,其双任务表现优于 Dagger 等算法,毫米级芯片插入一次完成,作业效率达人类操作员的 1.5 倍。
ICML 2026 共接收 6352 篇论文,其中 Spotlight 536 篇、Oral 168 篇,现场精选 8 篇代表作覆盖优化理论、智能体评测、强化学习与多模态理解等方向。其中 LoRA 梯度下降首次在无假设条件下被证明以 O(1/log T) 速率非渐近收敛;VLM 研究则发现模型检测视觉变化时准确率下降高达 60%,存在「说而不看」问题。
原力灵机在北京 Action 2026 开发者大会上发布自研 4B 具身基础模型 DM0.5,并同步推出通用具身本体 2.0-Apex 与 DexDev 开发者平台。
上海人工智能实验室青年科学家李林阳创办的芯片设计公司 Novasilicon(芯星元)完成首轮融资,由五源资本独家投资数千万元。该公司不做 EDA,而是让多 AI Agent 承担设计、规划、调用 EDA 及迭代优化,先从模拟后端版图设计和数字后端布局布线切入,计划年内推出标准化后端设计产品。
哈佛大学教授 Sham Kakade 在 ICML 2026 演讲中论证,一个简单二次模型即可精准预测 LLM 动态预训练中的大部分优化效果。他通过对真实大规模神经网络不同 checkpoint 做泰勒展开构建二次模型,发现关键窗口内损失轨迹与真实网络近乎完全重合,高阶项几乎无贡献。该框架可推导任意时间学习最优策略、临界批量大小与动态最优学习率,并揭示动量的作用边界。
ICML 2026 于 7 月 7 日在首尔 COEX 开幕,共接收 6352 篇论文,其中 Spotlight 论文 536 篇、Oral 论文 168 篇。
Google DeepMind 的《Asynchronous Methods for Deep Reinforcement Learning》获 ICML 2026 时间检验奖,一作 Volodymyr Mnih 现场领奖。
英伟达、普林斯顿与 MIT 联合团队提出的首个视频运动归因框架 Motive 获 ICML 2026 杰出论文提名,仅用 10% 高影响力运动数据微调,人类偏好胜率达 74.1%,超过 100% 全量数据微调。该框架通过像素级位移流场与运动掩码剥离静态外观,在 VBench 动态程度指标上取得 47.6%,高于纯运动幅度筛选的 40.1% 和 V-JEPA 语义筛选的 41.6%。
AI科技评论专访 LaST-HD 一作、至简动力北大联合实验室 RD 负责人刘家铭,探讨人手数据如何重塑机器人基础模型。刘家铭称,截至 LaST-HD 论文发布,公司预训练可用人手数据为 2000 小时,年底预计到一两万小时,最大训练量 2 万多小时时模型已出现不错的泛化能力。他认为人手数据与真机数据并非替代关系,VLA 与世界模型也可在系统中共存,具身智能的终局竞争在于长尾与个性化。
ICML 2026 于 7 月 7 日进入正会第一天,共接收 6352 篇论文,其中 Spotlight 536 篇、Oral 168 篇。雷峰网从 Poster 展区精选 9 篇论文,涵盖 FlashBlock、Stem、PBS-Attn、EchoAttention 等注意力效率优化成果,以及持续学习、多模态融合、表格建模和基因组可解释性等方向。
OpenAI 前研究员田永龙(Yonglong Tian)已于近期加入腾讯,知情人士称其后续或将参与 VLM(视觉语言模型)相关研发。他此前在 OpenAI 担任 Member of Technical Staff,研究方向包括计算机视觉、视觉表征学习与生成式模型,2024 年 5 月从 Google Research 转入 Google DeepMind。
ICML 2026 于 7 月 7 日进入正会第一天,共接收 6352 篇论文,其中 Spotlight 论文 536 篇、Oral 论文 168 篇。
AI科技评论对 Hugging Face 上开源的 10B 图像模型 Boogu-Image-0.1 的 Base、Turbo、Edit 三个版本做了实测。在 Qwen-Image-Bench 上它以 53.58 分领先 20B 的 Qwen-Image-2512(52.06)和 80B 的 Hunyuan-Image-3.0(50.81)。
至简动力在苏州宣布完成首批百台 i7 Pro 工业具身机器人交付,并落成一条 CNC 智能化具身机器人产线,此时距公司成立不足一年。该产品定位开箱即用,客户可在一周内完成部署;首批最大客户绿的谐波测算,一台机器人综合使用成本与一名人力相当但可 24 小时运转,约一年回本。至简动力核心团队来自理想汽车,贾鹏判断行业仍处于 0 到 0.1 阶段,万台年交付才算真正的 0 到 1。
AMI Labs 联合创始人冯雁在 ICML 2026 首个特邀演讲中提出,AI 智能体从数字空间走向物理世界需要世界模型,并论证 JEPA 路线相较生成式世界模型在推理速度、参数量与鲁棒性上更具结构性优势。
Anthropic 发布名为 A global workspace in language models 的新研究,提出 J-space 内部表示和 Jacobian Lens(J-lens)读取方法,用于观察 Claude 生成回答前中间层已形成的概念。
ICML 2026 首日,小米 MiMo 团队罗福莉与曹士杰介绍了 MiMo-V2.5 系列如何通过架构、训练与推理协同设计兼顾速度、能力与成本。预训练侧,MiMo-V2.5 采用混合滑动窗口注意力,以 7:1 稀疏比和 128 token 窗口将注意力 FLOPs 与 KV 缓存降低 7 倍,MiMo-V3 的 High Sparse 架构把稀疏比推到 11:1。
DeepSeek 在官方 API 文档中给出 thinking mode 与 tool call 结合使用的样例,要求工具调用产生的 reasoning_content 完整保留并在后续请求中回传,否则可能触发 400 错误。
多方线索指向 GPT-5.6 或于 7 月 7 日发布,Polymarket 交易数据给出的概率高达 68%,OpenAI Codex 应用底层代码已写入 Sol、Terra、Luna 适配条目。
ICML 2026 于7月6日至11日在韩国首尔 COEX 召开,投稿量达23918篇、录用6352篇,录用率26.6%。快手11篇论文入选(含1篇Spotlight),阿里千问C端团队4篇入选(ECHO框架获Spotlight),中科院自动化所50篇论文入选,腾讯混元以HunyuanWorld-Mirror布局3D世界重建。中国企业还通过汉江邮轮晚宴、人才交流会等活动加深现场参与度。
ICML 2026 在韩国首尔开幕,共收到 23918 篇有效投稿,录用率 26.6%,清华大学黄高团队的《The Flexibility Trap》获杰出论文奖,Google DeepMind 2016 年发表的 A3C 论文《Asynchronous Methods for Deep Reinforcement Learning》获时间检验奖。
北京大学杨超教授领衔的团队已完成首轮过亿融资,正式布局物理 AI 底层基础设施赛道。杨超是我国首位 ACM 戈登贝尔奖得主,团队搭建起"高性能计算+物理仿真+AI"三位一体的全栈技术体系。该团队入场有望填补国内物理 AI 底层基础设施自主可控领域的空白。
AI 科技评论梳理 ICML 十年重磅演讲,呈现一条从 AlphaGo 时代「算法能解决一切」到质疑「解决本身」的轨迹。2016 年 David Silver 用 66 页幻灯片讲深度强化学习,2025 年 Google DeepMind 的 Anca Dragan 则指出奖励函数与人类意图错位。
开发者 dax 在 Claude Fable 5 的调用日志中发现降级原因字段标着 TOO_DUMB_TO_NEED_FABLE,并向 Anthropic 工程师 Thariq 求证,对方回复证实了该字段的存在。
ICML 2026 投稿量从去年 12,107 篇飙升至 23,918 篇,接收率仍为 26.56%。评审偏好集中于大模型机制可解释性(约 1,870 篇)、AI for Science 深水区(约 860 篇)与具身智能(超 420 篇)三大方向,纯工程调参和提示工程类工作遭明确排斥,数学理论硬度与鲁棒性安全性权重上升。
香港中文大学(深圳)刘桂良团队联合跨维智能提出 Focus-Then-Contact(FTC)框架,在卡片插入、挂钥匙扣、充电器抓取插入等 6 个真机接触任务中实现 100% 成功率,平均真机训练时间 27.5 分钟。
Claude Sonnet 5 发布不到 24 小时便因性价比遭遇刷屏差评。一张来自 GitHub 的私有题库跑分图显示,MiniMax-M3 以 61.95 分领先,Qwen3.7-Plus 在极限分上与 Sonnet 5 持平,而同一套测试 Sonnet 5 花费 71.96 元,Qwen 与 MiniMax 分别只要 11.71 元和 11.64 元。
OpenAI 工程师开发出一种优化技术,将应用该技术的模型推理成本降低了一半,用于未登录访客的 ChatGPT 服务时所需英伟达 GPU 降至几百块,但具体技术细节未公开。DeepSeek 与北京大学联合发布投机解码方法 DSpark,在 V4 模型上实现每位用户推理速度 60%-85% 的提升,无需重新训练权重,已在 MIT 许可证下开源,适用于 V4 Flash 和 Pro 模型。
图灵奖得主 Yann LeCun 两连推的 VISReg 提出新正则化方法,通过解耦尺度与形状并引入基于切片 Wasserstein 距离的素描目标,解决 JEPA 世界模型的表征坍塌问题。
小米 Darwin Agent Team 发布论文《HarnessX》,提出让 Agent 的 Harness 通过强化学习自我进化的框架,在 15 组对比实验中平均提升 14.5% 性能。
第43届 ICML 2026 将于7月6日至11日在韩国首尔 COEX 会展中心举行,今年投稿23918篇、接收6352篇常规主赛道论文,接受率26.6%,增幅达102%;会议新增参会展示可选、原始投稿版本(含审稿意见与 Rebuttal)公开两项制度。
李飞飞、NVIDIA 的 Jim Fan、徐丹飞等联合发布论文《T-Rex: Tactile-Reactive Dexterous Manipulation》,为灵巧手触觉反馈提出单独的高频处理通路。