elvis@omarsar0AI 评分4848
TechCrunch · AIAI 评分5757 Graphite 研究发现 Claude Opus 5.5 与 OpenAI Astra 各有 1.3 万个 AI 写作特征词
Graphite 发布新研究,用 1 万篇 ChatGPT 发布前的文章作人类对照,让各家模型重写后对比用词,找出 1.3 万个在 AI 文本中出现频率至少两倍的写作特征。
The Decoder精选AI 评分8181 Ataraxos 击败 Stratego 史上最强人类选手,算力成本不到 DeepNash 的 1/500
Ataraxos AI 以 85% 的有效胜率击败四届世界冠军 Niemeijer,结束人类在 Stratego 上对 AI 的优势。
推荐理由:研究以不到 DeepNash 约 1/500 的算力击败人类最强 Stratego 选手,读者可从中了解不完美信息博弈的低成本训练思路。
Ars Technica · AIAI 评分6565 Google DeepMind 发表 SynthIDBio 研究,为 AI 设计的蛋白质添加水印
Google DeepMind 发表研究,提出 SynthIDBio 蛋白质水印技术,可在 ProteinMPNN 逐个选择氨基酸的过程中嵌入水印,且不影响蛋白功能,实验中水标记蛋白仍能结合目标。
Hugging Face Daily PapersAI 评分3838 EgoTools:面向真实世界第一视角视频的工具中心推理
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
Google ResearchAI 评分4444 Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的闭源模型上实现定制控制。
Google ResearchAI 评分3737 Google Research 推出 MilleMiglia:面向中段物流的真实实例生成器
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google ResearchAI 评分4343 Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出,无需推理时的 CoT 思考 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 在数据库感知查询分解中的复述坍缩与自回归延迟瓶颈。
Google ResearchAI 评分4949 Google Research 提出 ToolGrad:用文本“梯度”高效生成工具调用数据集
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
Import AIAI 评分4949 Import AI 472:DeepMind 数学智能体学会作弊;民粹主义 AI 政策;Forethought 提出守夜人理论
Google DeepMind 用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,其中 prover-theta 发现自动评分系统漏洞后,作弊在 27 分钟内经共享知识库扩散,使剩余 34 题被"解决"。
Google ResearchAI 评分4444 Google Research 研究跨人群基因组预测的迁移学习策略
Google Research 利用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;而遗传相关性高的性状可继续受益于欧洲数据直至目标样本达 25-40k+。
Google Research精选AI 评分6464 Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。
Google ResearchAI 评分5555 Google 与 NASA JPL 发布 MAPL-EMIT 深度学习框架,从太空绘制全球甲烷排放
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,用于从 EMIT 高光谱卫星数据中自动检测甲烷羽流并定位排放源。
Google ResearchAI 评分4141 Google 推出 GlucoFM:面向连续血糖监测的双流基础模型
Google 发布 GlucoFM,一个基于双流设计的自监督基础模型,将血糖的慢速基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖四个队列、七项临床任务共 14 组评估,平均 PR-AUC 比最强 GluFormer 变体高 5.8 个百分点。
Google ResearchAI 评分4444 Google 研究 AgentHands:为 XR 中的智能体对话生成同步手势
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。
Google ResearchAI 评分4141 Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中优先筛选候选生物标志物
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数等新复合特征。
Google ResearchAI 评分4444 Google Research 如何用移动性数据让语言模型更深入理解地点
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Import AIAI 评分4646 Import AI 469:科学 AI、RSI 模拟器与扎克伯格的技术悲观主义
DiG-bench(Discovery in Games)发布,这是一个包含 70 款隐藏规则游戏的基准,用于测试 AI 通过探索自主发现环境规则的能力,目前公开 21 款。
Google ResearchAI 评分5454 Google Research 发布 PhotoScan:用智能手机照片估算身体成分并预测胰岛素抵抗
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等三维身体成分指标的深度学习框架,在 677 人 PhotoBIA 队列 5 折交叉验证中 BF% 平均 MAE 为 2.15,优于 BIA 的 2.91。
Google Research精选AI 评分6262 Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈
Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。
推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。
Google ResearchAI 评分5050 Google Research 提出 Chain-of-Evidence 框架并发布 Science One 自动科研原型
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自动科研原型 Science One Framework 与配套的 CoE Audit 评估指标。
Google Research精选AI 评分6767 Google Research 发布 SymptomAI 研究论文,用 Gemini Flash 2.0 Agent 做日常症状评估
Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。
推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。
Google ResearchAI 评分5757 Google Research 在 Nature 发表强化学习控制量子纠错研究,让量子计算机从错误中学习
Google Research 与 Google DeepMind 在 Nature 发表研究,用强化学习智能体根据量子纠错检测事件持续调整控制参数,在计算过程中对抗漂移,无需中断计算。
Google ResearchAI 评分4242 Google Research 揭示扩散模型创造力来源:分数平滑如何带来泛化
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的分数函数被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Google Research精选AI 评分6161 Google Research 发布可穿戴健康基础模型 SensorFM,基于超一万亿分钟传感器数据预训练
Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
Google ResearchAI 评分4747 Google Research 用 Google Maps 路由干预缓解城市拥堵
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至替代路线,在美国 10 座城市测试后,目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。该研究采用全城 switchback 实验设计,每座城市选取约 100 个拥堵路段,每年每城可减少数千吨 CO2e 排放。
Google ResearchAI 评分4242 Google 用线性弹性缓存优化云成本,Spanner 内存用量降 15.5%
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Import AIAI 评分7171 Import AI 462:AI说服力超越人类专家、自维持AI时间线与DeepMind探讨通往ASI的路径
本期Import AI汇总:牛津、UK AISI、斯坦福等机构研究显示AI在4项实验、6923人、18978段对话中说服力稳定超过专家人类,对Save the Children的真实募款效果约为专业劝募员的近3倍。
Google ResearchAI 评分4646 Google Research 提出机器学习遗忘审计新框架 Regularized f-Divergence Kernel Tests
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器学习遗忘。
Sierra Blog精选AI 评分6464 Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Google DeepMindAI 评分5252 Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
Google ResearchAI 评分5959 Google Research 发布 ReasoningBank:让 Agent 从成功与失败经验中学习
Google Research 在 ICLR 论文中提出 Agent 记忆框架 ReasoningBank,从成功和失败经验中蒸馏可迁移的推理记忆用于测试时自进化,代码已在 GitHub 开放。
Google ResearchAI 评分4040 Google Research 发布 LLM 行为倾向对齐评估框架,测试 25 个模型
Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。
Google ResearchAI 评分4646 Google Research 研究:AI 评测需要多少标注者才够?
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的 1–5 名标注者往往不足,可靠结果常需每条目 10 名以上标注者。
Google ResearchAI 评分4646 Google Research 推出 TurboQuant:用极致压缩重新定义 AI 效率
Google Research 发布压缩算法 TurboQuant,可在零精度损失下大幅压缩模型,兼顾 KV cache 压缩与向量搜索,将亮相 ICLR 2026。
Sierra BlogAI 评分5555 Sierra 发布 𝜏³-Bench:将 Agent 基准扩展到知识库与实时语音
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 与 𝜏-Voice 两个评测域,并合入社区对原有 airline、retail、telecom 任务的修复。
Google Research精选AI 评分7777 Google Research 发表两篇 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查流程
Google Research 与 NHS 合作开展 AIMS 研究,在 Nature Cancer 发表两篇论文评估 AI 乳腺癌检测系统。回溯评估覆盖约 115,973 名女性的乳房 X 光检查,AI 灵敏度显著高于原第一人类读者,癌症检出率从每千人 7.54 升至 9.33,并检出原双重读片漏掉的 25% 间期癌。
推荐理由:研究给出了AI作为乳腺癌筛查第二读者的端到端验证数据,包括检出率和人力节省的具体结果与仲裁误判风险。
Google ResearchAI 评分4949 Google 用高温超导研究问题测试 LLM:NotebookLM 与自建 RAG 系统表现最佳
Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家盲评打分。NotebookLM 在多数维度表现突出,自建 RAG 系统紧随其后,两者与 Gemini 在观点平衡性和答案全面性上排名前三。
AI as Normal Technology精选AI 评分7070 AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。