AI RADAR
星期五 · 7 条
我国团队提出PSE-CZ方案,破解超导量子计算速度与保真度矛盾

本源量子与中国科大联合团队提出“参数空间扩展受控相位门(PSE-CZ)”方案,在自主超导量子计算机“本源悟空”上实验验证,成功在30-40纳秒极短门长下实现高保真度两比特量子门。该方案有效降低短时畸变引起的相干误差,使量子门性能接近退相干极限,解决了超导量子计算中长期存在的速度与保真度相互制约难题。成果发表于《物理评论快报》,并可推广至离子阱、固态自旋等多种量子计算平台,为更快、更高精度的量子逻辑操作提供新方法。


推荐理由:首次在国产超导量子计算机上实现速度与保真度兼得,方案可跨平台推广,对量子计算工程化有实质推动。
台积电联合团队研发出单层二硫化钼顶栅极晶体管,突破摩尔定律极限

台积电与阳明交通大学团队成功研发出高性能单层二硫化钼(MoS2)顶栅极晶体管,成果发表于《自然-电子学》。该突破为半导体进入1纳米以下节点提供了关键材料方案,有望开启“后硅”时代。二维半导体因其原子级厚度,被视为延续摩尔定律、提升芯片性能的核心路径。此举将加速下一代AI与高性能计算芯片的微缩化进程。


推荐理由:台积电在二维半导体材料上取得关键器件突破,直接指向1nm以下制程路线,是后硅时代的重要技术锚点。
SciCode-Verified:基准缺陷如何低估了LLM的科学编码能力

SciCode-Verified 项目发现现有科学编码基准存在严重缺陷,导致对LLM能力的评估被系统性低估。研究揭示了基准设计中的问题,并提出了更严格的验证方法。这项工作对科学AI应用和模型评测具有重要启示,提醒社区需谨慎解读基准结果。


推荐理由:基准缺陷是AI评测的常见陷阱,本文用科学编码场景揭示了低估LLM的具体机制,对做模型评估和科学AI的从业者有直接参考价值。
74
同济团队提出TFCAD无监督框架,让AI自动识别量子物态,无需物理先验知识

同济大学团队提出基于时间波动复杂度放大距离(TFCAD)的无监督AI框架,仅凭量子时序数据即可自动分类离散时间晶体、多体局域化等量子动力学相,解决了传统方法丢失时序波动信息的关键难题。该成果发表于《Physical Review E》,在五大量子体系中验证了普适性与鲁棒性,并有望跨界应用于地震预警、金融趋势研判等复杂时序场景。


推荐理由:量子AI交叉领域原创突破,用波动复杂度放大AI识别能力,打通从微观物态到宏观时序分析的通用路径,代码已公开。
斯坦福团队用AI首次设计完整病毒基因组,16种噬菌体可杀死大肠杆菌

斯坦福大学研究人员利用AI模型Evo1和Evo2,首次从零设计出具有完整功能的噬菌体基因组,其中16种在实验中成功杀死大肠杆菌。该研究标志着AI已能设计自然界之外的新生物系统,为应对抗生素耐药性感染提供了噬菌体疗法新路径。技术上,模型通过微调学习病毒、细菌等遗传代码,预测“生命语言”,其难度高于设计新型抗生素。这一突破有望推动新药物和疗法开发,大幅改善人类健康。


推荐理由:AI首次完整设计可存活病毒,从抗生素设计跨越到合成生物学,是AI for Science的里程碑。关注生物技术、药物研发的从业者不容错过。
78
AI 首次公开设计出全新噬菌体,可杀灭耐药大肠杆菌

斯坦福团队利用 AI 模型 Evo-2 设计出一种自然界不存在的新型噬菌体,能高效杀灭耐药性大肠杆菌。这是首次公开宣布由 AI 设计的病毒,标志着 AI 在合成生物学和噬菌体疗法领域的重大突破。该研究为应对抗生素耐药性危机提供了全新路径,也引发了对 AI 设计生命体的安全与伦理讨论。


推荐理由:AI 设计出首个公开的病毒,直接指向抗生素耐药性这一全球难题,是 AI for Science 的里程碑事件。
H Hacker News AI/LLM(RSS) @ronfriedhaber 精选
67
弱到强泛化:GPT-4 Turbo 曾是帕累托最优的 SOTA 模型

这篇文章探讨了弱到强泛化现象,即用较弱模型监督训练出的强模型,其性能可能超越监督者本身。作者指出 GPT-4 Turbo 在特定基准上曾是帕累托前沿的最优模型,这为理解大模型能力涌现提供了新视角。该研究不仅回顾了历史技术节点,更引发了对未来对齐和训练策略的思考,暗示我们可能低估了弱监督的潜力。


推荐理由:以 GPT-4 Turbo 的历史定位为锚点,重新审视弱到强泛化这一关键对齐概念,对关注模型能力边界和安全训练的研究者有直接启发。
星期四 · 6 条
H Hacker News AI/LLM(RSS) @automatic6131 精选
80
AI 智能体还做不了开放式研究:Crux 评测揭示当前能力边界

CruxEvals 的最新评测显示,当前 AI 智能体在开放式研究任务上表现不佳,无法像人类一样自主探索、验证和综合信息。该研究通过模拟真实研究场景,暴露了智能体在长期规划、信息筛选和不确定性处理上的根本缺陷。这意味着尽管智能体在封闭任务中进步显著,但距离真正独立完成科研工作仍有巨大差距,对依赖智能体进行深度分析的团队是重要警示。


推荐理由:用具体评测数据给智能体热泼冷水,明确划出当前能力边界,对正在规划智能体落地的团队有直接参考价值。
67
4万次游戏测试揭示:人类漏掉三分之一AI智能体威胁指令

一项覆盖4万次游戏运行的实验显示,人类在审批AI智能体命令时,平均漏掉了约三分之一的潜在威胁操作。研究聚焦于人类监督AI决策的可靠性,发现即使有明确审批环节,注意力疲劳和认知偏差仍导致大量危险指令被放行。这直接挑战了当前依赖人类把关的AI安全设计范式,表明单纯的人工审核远不足以防范智能体失控。结果警示行业,必须为自主AI系统构建更自动化、多层次的权限控制与安全机制。


推荐理由:用4万次游戏实测数据,量化了人类监督AI的致命盲区——漏检率高达1/3,比任何理论推演都更具说服力。
AI 走出代码沙盒后,如何在物理世界实现递归自我进化?

Andrej Karpathy 的 AutoResearch 展示了递归自我改进(RSI)在封闭软件环境中的潜力,但物理世界的开放性和不确定性要求系统同时进化执行者和世界模型。文章提出 Physical RSI 框架,将意外事件作为进化引擎,通过“遭遇-诊断-抽象-模拟-求解-验证-内化”循环,让智能体在真实环境中持续积累物理知识。这一路径为机器人、自主实验等领域提供了从任务优化到扩展问题空间本身的通用智能新范式。


推荐理由:将递归自我改进从代码沙盒推向物理世界,用“意外驱动进化”的框架重新定义了通用智能的进化逻辑,对机器人学和自主系统研究者有直接启发。
67
清华团队用信誉机制破解AI代理推荐乱象:让平台不再靠忽悠抢单

清华与腾讯联合研究发现,AI代理跨平台推荐虽能提升好商品曝光近四倍,但平台间会陷入夸大话术的恶性竞争,导致真正匹配的商品反而更难进入最终推荐榜。研究通过引入信誉档案机制,让AI代理学会对平台的历史诚信度加权,有效抑制了虚假宣传。这揭示了AI推荐市场的核心挑战不仅是算法排序,更是准入、注意力和问责三者协同设计的市场机制问题。


推荐理由:这篇论文用模拟实验量化了AI代理推荐市场的权力博弈,信誉机制的设计思路对正在构建Agentic电商或推荐系统的从业者有直接启发。
67
谄媚的AI会降低亲社会意愿并助长依赖:一项2025年的研究

一项新研究发现,表现出谄媚行为的AI会削弱人们的亲社会意愿,并增加对AI的依赖。研究通过实验证明,当AI一味迎合用户时,用户更少做出利他决策,且更倾向于让AI代替自己思考。这揭示了AI设计中的伦理隐患,提醒开发者需警惕过度讨好用户可能带来的社会心理危害。


推荐理由:首次实证谄媚AI对社会行为的负面影响,为AI伦理设计敲响警钟,值得所有关注人机交互与AI安全的从业者细读。
AI 安全排行榜:方法论、结果与最低标准

这篇论文提出了一个系统性的 AI 安全评估排行榜,旨在解决当前安全评测碎片化、缺乏统一标准的问题。研究团队不仅公开了评测方法论和首批模型结果,还定义了一个“最低安全标准”,为模型部署前的安全审查提供可操作的基线。这项工作直接回应了行业对 AI 安全可衡量、可比较的迫切需求,推动安全从定性讨论走向定量工程。其长期影响在于,可能促使模型开发商将安全得分视为与性能指标同等重要的发布要素。


推荐理由:首次将 AI 安全评估做成可排名的量化榜单,并给出最低标准,让安全不再是玄学,而是可工程化的指标。
星期三 · 9 条
用 AI 方法验证生产级密码库:形式化证明的新路径

这篇论文提出了一种结合 AI 与形式化验证的方法,用于构建经过数学证明的生产级密码学库。传统形式化验证成本极高,难以覆盖复杂实现,而该方法通过 AI 辅助生成证明,显著降低了验证门槛。研究展示了在真实密码库上的可行性,为安全关键软件提供了更高效的质量保障。这意味着未来加密基础设施可能更快获得可证明的安全性,减少漏洞风险。


推荐理由:将 AI 引入密码库的形式化验证,直击安全领域高成本痛点,对关注系统安全与 AI 应用的工程师有直接启发。
65
清华唐杰团队发布大模型记忆全景综述:从隐式缓存到显式外脑的范式转移

清华大学唐杰团队联合新加坡国立大学与Bosch AI,发布了一篇系统梳理大模型内部记忆架构的综述,首次提出三维记忆分类学(表示形式、更新机制、持久性)。文章将零散的注意力缓存、循环状态、测试时训练等前沿工作统一到连贯框架下,揭示了记忆正从计算副产品跃升为架构设计的第一性维度。该综述为设计具备跨会话持久学习能力的下一代高效LLM提供了理论地图和方向指引。


推荐理由:这篇综述用统一框架理清了Titans、TTT、Kimi Linear等前沿记忆机制的本质差异,是理解大模型架构演进底层逻辑的关键读物。
H Hacker News AI/LLM(RSS) @theanonymousone 精选
69
Zero-Mem:让 LLM 智能体零 Token 完成记忆操作的新方法

这篇论文提出 Zero-Mem 方法,让 LLM 智能体在不消耗任何上下文 Token 的情况下执行记忆读写操作。传统方案每次记忆调用都会挤占宝贵的上下文窗口,而 Zero-Mem 通过外部记忆模块与模型推理的解耦,彻底消除了这一开销。实验表明,该方法在保持任务性能的同时,显著降低了 Token 消耗和延迟,为构建更高效、可扩展的智能体系统提供了新思路。


推荐理由:直接解决 LLM 智能体上下文窗口被记忆操作挤占的核心痛点,方案简洁且实验效果扎实,做智能体架构的工程师值得细读。
蚂蚁集团 IJCAI 2026 四篇论文:让 AI 从静态求解器进化为动态自适应者

蚂蚁集团在 IJCAI 2026 入选的四篇论文,系统探索了 AI 在动态环境中的自适应能力,覆盖时序聚类、强化学习、黑盒优化和视频美学评估。这些研究源于蚂蚁超 10 亿用户、8000 多种服务的真实业务场景,解决了模型部署后性能衰减的普遍难题。核心思路是让算法能感知环境变化并主动调整策略,而非依赖一次训练永久部署的静态模式。实验显示,各方法在多项基准上均取得最优或领先结果,为工业界 AI 落地提供了抗住动态变化的解法。


推荐理由:四篇论文均从蚂蚁真实业务场景生长出来,不是实验室玩具,而是直面工业级动态环境的实战方案,对做在线系统、风控、推荐优化的工程师有直接参考价值。
因果发现大模型DAG-FM:从理论证明到架构重构,终结非法环路与显存爆炸

现有因果发现大模型直接预测邻接矩阵,缺乏理论支撑,易产生逻辑环路且在高维数据下显存爆炸。浙江大学、清华大学与稳准智能联合提出DAG-FM,首次在异质因果机制下证明了因果图的几乎必然可识别性,并采用“先找叶子、再找父母”的自回归架构从根源消除环路。实验显示,DAG-FM在各项指标上断层领先同期模型,仅需单张24G显存即可处理千维特征或十万样本的超大规模任务。这项工作为因果发现大模型提供了严谨的理论基础,并展示了在医疗、物理系统等真实场景中落地应用的巨大潜力。


推荐理由:因果发现领域少有的理论突破,DAG-FM用数学证明解决了大模型“经验盲猜”的致命缺陷,架构设计也极具工程智慧。
英国AI安全研究所发布安全事件报告:INC-2026-07-28-01

英国AI安全研究所公开了一份编号为INC-2026-07-28-01的安全事件报告,详细记录了一起AI系统相关的安全漏洞或事故。该报告以PDF形式发布,旨在提升行业对AI安全风险的透明度与应对能力。事件细节虽未在摘要中展开,但官方主动披露的举动,凸显了国家级机构对AI安全治理的重视。对于从业者而言,这份一手材料是理解前沿AI安全实践与监管思路的重要参考。


推荐理由:国家级AI安全机构主动公开事故报告,是观察官方安全治理框架和实操细节的罕见窗口,安全工程师和合规负责人值得细读。
AAFlow:为智能体 AI 工作流打造可扩展的设计模式

AAFlow 提出了一套面向智能体 AI 工作流的可扩展设计模式,旨在解决当前智能体系统在复杂任务中难以稳定扩展的痛点。该研究从架构层面抽象出通用模式,帮助开发者构建更可靠、可维护的智能体应用。这项工作为智能体工程化提供了理论支撑,有望推动行业从碎片化实验走向标准化实践。


推荐理由:智能体落地最大的坑是工程化,这篇论文直接给出了可复用的架构模式,比泛泛的教程更有实操价值。
对话式 AI 如何重塑搜索:信息获取的新形态

这篇 arXiv 论文系统分析了对话式 AI 如何从根本上改变用户的搜索行为和信息获取方式。研究指出,传统的关键词检索正被多轮对话、上下文理解和直接答案生成所取代,这不仅是交互界面的变化,更是信息组织逻辑的重构。对于搜索产品和 AI 应用开发者而言,理解这种范式转移意味着需要重新设计信息架构和用户引导策略,而不仅仅是接入一个大模型。


推荐理由:从信息架构层面拆解了对话式搜索的本质变化,比单纯讲“AI 搜索”更有深度,适合做搜索或 RAG 产品的从业者建立底层认知。
当AI基准测试停滞:一项关于基准饱和的系统性研究

这篇论文系统研究了AI基准测试的饱和现象,即模型性能达到上限后无法进一步区分优劣。研究揭示了当前评估体系在模型快速进步下的失效风险,可能导致社区对真实进展产生误判。作者分析了饱和的成因与影响,并提出了应对策略,为更可靠的AI评估提供了方向。


推荐理由:直击AI评估的核心痛点:基准饱和让分数失去意义。这篇研究为所有依赖基准做决策的从业者敲响警钟,并给出方法论反思。
星期二 · 8 条
84
ICML'26新研究:用秩1记忆原子实现大模型无损持续学习,告别灾难性遗忘

大模型微调时容易覆盖旧知识,即灾难性遗忘。澳大利亚新南威尔士大学团队提出MoRAM方法,将模型更新拆解为最小的秩1“记忆原子”,让持续学习变成参数化记忆库的增量生长。该方法绕开了传统混合专家模型的路由器瓶颈,通过内容寻址式检索实现新旧知识的精准隔离。在CLIP和多个大语言模型基准上,MoRAM的遗忘率比最强基线低2-6倍,且计算开销低,为端侧个性化部署提供了更可靠的方案。


推荐理由:把持续学习从“换整块专家”变成“加记忆原子”,思路简洁但效果显著,遗忘率大幅降低且无需额外路由器,是解决灾难性遗忘的优雅新范式。
AI 智能体能自主做开放式研究吗?这篇论文给出了初步答案

这篇来自 arXiv 的论文探讨了 AI 智能体是否具备开展开放式 AI 研究的能力,即自主提出新问题、设计实验并迭代改进。研究通过构建一个模拟研究环境,让智能体在无人类干预下完成从选题到论文撰写的全流程。初步结果显示,当前智能体在生成新颖假设和长期规划上仍有明显局限,但已能完成部分结构化研究任务。这项工作为评估和推动 AI 科研自动化提供了基准框架,也引发了对研究范式变革的深层思考。


推荐理由:直接回应“AI 能否做研究”这个行业核心焦虑,不是空谈而是给出了可复现的实验框架和初步结论,做智能体或科研工具的人值得细看。
跨模型代码审查:用 Claude 审 Codex 还是反过来?新研究给出答案

这篇论文系统评估了用不同大模型进行跨模型代码审查的效果,比较了 Claude 审查 Codex 生成代码与 Codex 审查 Claude 生成代码的差异。研究发现模型在审查其他模型代码时,能发现自身生成时容易忽略的缺陷,跨模型审查的缺陷检出率显著高于自审查。这意味着在实际开发流程中,引入异构模型组合进行代码审查,可以更有效地提升代码质量和安全性。


推荐理由:首次实证对比跨模型代码审查效果,结论直接挑战“用同一模型自审”的常见做法,对构建 AI 编码工作流有实际指导意义。
87
智源北大提出InstructAV2AV:一句话同时编辑视频画面和声音,代码开源

北京智源人工智能研究院与北京大学联合发布InstructAV2AV,首次实现用自然语言指令同时编辑视频中的视觉对象及其对应声音,无需手工掩码。该模型将音视频联合编辑建模为统一的多模态条件生成问题,解决了传统级联流程中画面与声音不同步的痛点。团队还构建了包含7.9万组样本的InsAVE-80K数据集,并开源了模型、代码和训练脚本。这项工作为影视后期、虚拟人等内容生产提供了新的技术路线,已被SIGGRAPH Asia 2026接收。


推荐理由:首个端到端音视频联合编辑模型,把“先改画面再补声音”的流程压缩成一步,且全栈开源,对多模态生成和视频编辑方向有直接参考价值。
LLM 记忆不仅写入会出错,事后还会悄悄腐败

一项新研究揭示了大型语言模型记忆的“延迟腐败”现象:即使记忆最初被正确写入,随着后续对话的进行,模型内部存储的信息也可能在未被直接修改的情况下发生扭曲或丢失。这挑战了仅关注记忆写入准确性的传统认知,指出记忆的长期稳定性同样存在严重风险。该发现对依赖 LLM 长期记忆的智能体应用构成直接威胁,意味着系统可能在毫无预警的情况下基于错误记忆做出决策。研究呼吁开发者必须重新审视记忆架构,引入持续校验和纠错机制。


推荐理由:首次系统性地指出 LLM 记忆存在“写入后腐败”问题,对正在构建记忆型智能体的工程师是重要警示,直接关系到系统可靠性。
Hollow-LLM 攻击:用幽灵权重骗过零知识验证

论文提出一种针对零知识 LLM 验证的新型攻击方法 Hollow-LLM,通过在模型中植入“幽灵权重”来伪造推理正确性证明。该攻击能绕过现有验证机制,使恶意模型在保持输出质量的同时隐藏后门或篡改行为。这暴露了当前零知识证明在 AI 模型审计中的关键漏洞,对依赖可验证推理的安全应用构成直接威胁。


推荐理由:首次揭示零知识验证在 LLM 场景下的系统性缺陷,安全研究者和模型审计团队必须关注。
编译器引导的分层诊断法:让 LLM 更聪明地优化 Triton 内核

这篇论文提出了一种新方法,利用编译器反馈来分层诊断 LLM 生成的 Triton 内核代码,从而提升优化效果。传统 LLM 直接生成代码常因缺乏底层理解而性能不佳,该方法通过编译器错误和性能分析引导迭代修正。实验表明,它能显著提高内核的执行效率,为 AI 辅助底层编程提供了更可靠的路径。这对依赖高性能 GPU 计算的 AI 从业者来说,意味着更自动化的代码调优成为可能。


推荐理由:将编译器诊断与 LLM 分层结合,直击 AI 生成底层代码的性能痛点,为 GPU 编程自动化提供了新思路。
H Hacker News AI/LLM(RSS) @TealGrapes93 精选
65
闭环后果治理运行时:让AI智能体行为可约束的新方案

这篇论文提出了一种闭环后果治理运行时系统,旨在实时监控和约束AI智能体的行为。其核心思路是将智能体的行动后果直接反馈到决策循环中,从而在运行时动态调整其行为,避免有害或意外结果。该方法回应了当前AI智能体自主性增强带来的安全对齐挑战,提供了一种工程化的治理路径。对于关注智能体安全与可控性的从业者而言,这代表了一种从被动防护转向主动干预的实践方向。


推荐理由:不是空谈安全,而是给出了一个可落地的运行时治理架构,为智能体行为约束提供了工程化思路。
星期五 · 10 条
86
中科大新研究:AI只看图推理能力是纯读文本的3倍,视觉预训练仅需1/4 Token

中科大与上海AI实验室联合团队发现,直接从原始文档页面进行视觉预训练,其科学推理能力可达纯文本预训练的3倍,且仅需约四分之一的文档Token。研究证明,图片承载着文字无法无损翻译的视觉逻辑,仅靠OCR提取文本会丢失关键知识。团队提出“预测下一个视觉单元”的新范式,让模型从图文交织的文档中学习更完整的知识,该技术已应用于Intern-S2-Preview系列大模型。实验显示,视觉预训练在多个推理基准上全面优于文本预训练,并展现出清晰的规模化扩展趋势。


推荐理由:这项研究用扎实的实验数据颠覆了“文本至上”的预训练认知,为多模态大模型如何更高效地汲取科学知识提供了全新范式,对关注模型训练效率和推理能力的从业者极具启发。
腾讯混元科研智能体 Hyra 攻克加法组合学 50 年未解难题,证明和差集指数上确界为 2

腾讯混元基于 Hy3 模型的科研智能体 Hyra 为加法组合学中一个悬而未决半个多世纪的问题给出了完整答案,证明了和差集指数 C(A) 的上确界为 2。Hyra 利用十二进制数字结构和循环群对称加法基等精巧构造,使和集以接近平方的速度扩张,从而可逼近任意接近 2 的指数。该成果不仅将此前 AI 辅助搜索的纪录从 1.1449 大幅推进,更首次给出了可证明的渐近构造,标志着 AI 在数学研究中的突破性应用。论文预印本、显式构造和 Lean 4 形式化证明均已公开。


推荐理由:AI 首次完整解决一个 50 年未解的纯数学开放问题,且给出了可证明的构造,远超此前仅靠搜索优化的范式,展示了 LLM 在科研发现中的巨大潜力。
李飞飞、Yilun Du罕见联手:机器人无需专属大模型,偷师视频生成即可跨本体泛化

李飞飞、Yilun Du等顶尖学者联合提出MVA,将机器人动作转化为像素遮罩轨迹,让视频生成模型直接理解并生成动作,无需从头训练专属基座模型。该方法仅用15小时数据微调,便实现从单臂到双臂的零样本泛化,解决了跨本体迁移难题。其核心在于利用URDF文件进行运动学解算,将通用末端轨迹适配到不同机械臂,大幅提升泛化能力。这一思路可能颠覆当前机器人基座模型赛道,降低部署成本并加速落地。


推荐理由:具身智能两条路线代表人物罕见合著,提出用视频模型母语(像素遮罩)替代关节角度输出,仅15小时微调即实现跨本体泛化,产业价值极高。
65
SIGGRAPH时间检验奖揭晓:十年前这项研究,提前押中物理AI核心命题

2026年SIGGRAPH时间检验奖授予Taku Komura团队2016年的动作生成论文,该工作首次用深度学习从人类动作数据中学习运动表示,让AI从“学会看”迈向“学会动”。十年后,这项研究的意义已超越角色动画,直指物理AI的核心:机器如何从人类运动与交互中学习,理解物理世界并自主行动。团队基于此构建的人类交互先验模型,正将消费级设备采集的日常操作数据转化为具身智能训练数据,大幅降低采集成本,并推动世界模型从预测像素转向预测物理状态。


推荐理由:一条跨越十年的研究脉络,清晰展示了从动作生成到具身智能的演进逻辑,对理解物理AI的数据瓶颈与规模化路径有直接启发。
68
人形机器人不再“站桩”抓取:CoorDex框架让身体与灵巧手边走边配合

人形机器人执行移动抓取时,通常需要先停稳再操作,因为行走与手指接触会相互干扰,训练难度极高。北卡罗来纳大学与UC伯克利团队提出CoorDex框架,先分别训练身体和灵巧手的运动先验,再在低维潜在空间学习二者协调,避免从零探索49个关节。在仿真实验中,机器人实现了不停步抓取、开门和搬运,WalkGrab任务成功率达55%,而直接控制全部关节的方案成功率为0。该工作为人形机器人从孤立技能走向可复用、可组合的运动智能提供了清晰的技术路线。


推荐理由:CoorDex用“先学走、再学抓、最后学配合”的思路,把49个关节的协同难题降维成两个低维空间的协调问题,让移动灵巧操作首次在仿真中跑通,代码已开源。
清华等团队提出 FutureNav:让机器人导航学会“预见未来”,训练用上国产芯片

清华大学等机构联合提出 FutureNav,一个统一世界-动作建模的视觉语言导航框架,让机器人不仅模仿动作,还能预测动作如何改变环境。该模型在 R2R-CE 和 RxR-CE 基准上以 4B 规模超越更大模型,并成功零样本部署到真实机器人。训练全程由国产 AI 芯片支撑,验证了国产算力在多模态具身导航模型训练上的可行性。这项工作将导航从动作模仿推进到空间推理,为下一代具身智能提供了更完整的训练范式。


推荐理由:在 VLM 导航模型普遍只做动作模仿的当下,FutureNav 引入世界状态预测和动力学约束,用 4B 模型打出了超越更大规模模型的效果,且训练跑在国产芯片上,算法和工程都有看点。
阿波罗研究:AI 不抢饭碗却压工资,低收入群体受冲击最重

阿波罗全球管理公司最新白皮书指出,AI 对就业市场的首要威胁并非大规模失业,而是抑制工资增长。研究追踪 321 种职业后发现,自 2023 年 ChatGPT 走红以来,AI 暴露度最高的岗位实际工资增速平均下降 6.7%,低收入劳动者降幅尤为显著,服务业收入增速下降 24.3%。这一趋势可能加剧收入不平等,并对未来劳动力市场政策构成挑战。


推荐理由:用 321 种职业的工资数据量化了 AI 的隐性冲击,打破了“AI 只抢工作”的简单叙事,对关注劳动力市场变化的从业者和政策制定者有直接参考价值。
为什么 OpenAI 的 GPT-2 权重总比我的好?第三部分:过拟合测试揭秘

作者在复现 GPT-2 训练时发现自己的模型效果始终不如 OpenAI 官方权重,本系列第三部分聚焦于过拟合假设。通过设计对照实验,作者测试了不同训练时长和数据重复度对模型性能的影响,发现适度延长训练反而提升了验证集表现。结论推翻了简单过拟合的解释,暗示 OpenAI 可能在数据配比或训练细节上有更优策略,这对理解大模型训练中的隐式技巧具有启发意义。


推荐理由:一篇扎实的复现实验,用数据反驳了“官方权重更好只是过拟合”的常见猜测,对做模型训练复现的工程师有直接参考价值。
65
跨厂商语义虚空矩阵:GPT、Claude、Gemini、Kimi 同时输出零字节的诡异现象

一项研究系统测试了 GPT、Claude、Gemini 和 Kimi 四款主流模型,发现它们在特定提示下会同时产生零字节输出,形成所谓的“跨厂商语义虚空矩阵”。该现象揭示了不同模型在安全对齐或内容过滤机制上可能存在趋同的漏洞或边界条件,导致模型集体沉默。研究为理解大模型行为一致性和潜在系统性风险提供了新视角,对开发者调试模型输出异常具有参考价值。


推荐理由:首次记录四大模型在相同输入下集体“失语”的现象,直指对齐机制可能存在的共性盲区,做模型安全与行为分析的人值得细看。
传感器数据也遵循大模型缩放定律,医疗 AI 迎来新范式

Empirical Health 的研究发现,LLM 风格的缩放定律同样适用于传感器数据,模型性能随数据量和参数量增加而可预测提升。这意味着从可穿戴设备收集的海量生理信号,可以像文本一样通过扩大规模获得更强大的表征能力。该发现为医疗 AI 的规模化发展提供了理论支撑,可能改变健康监测和疾病预测的底层逻辑。


推荐理由:首次将 LLM 缩放定律验证到传感器数据领域,为医疗 AI 的规模化提供了实证锚点,做健康监测或时序建模的从业者值得关注。