Apple 研究:用户自撰个人感知系统中的本体论边界协商
Apple 与斯坦福大学研究者设计了两款基于 Wizard of Oz 技术的开放式探针,让参与者训练自己定义现象的个人化机器学习系统,并在为期一周的探索性研究中日常使用。研究识别出四类本体论边界协商场景:现象边界、作为关系一部分的主体、信号与噪声之分、数据的客观性。该论文已被 ARES 2026 的 AI4TCI Workshop 接收。
machinelearning.apple.com · 网站与博客
Apple 与斯坦福大学研究者设计了两款基于 Wizard of Oz 技术的开放式探针,让参与者训练自己定义现象的个人化机器学习系统,并在为期一周的探索性研究中日常使用。研究识别出四类本体论边界协商场景:现象边界、作为关系一部分的主体、信号与噪声之分、数据的客观性。该论文已被 ARES 2026 的 AI4TCI Workshop 接收。
Apple 研究团队证明,离散扩散模型(含 remasking 与 uniform-state 采样器)单步生成只有在所写位置在已固定 token 条件下相互独立时才匹配训练分布,而逐位置分布的乘积无法拟合存在依赖关系的 token 组。在合成任务 ScanAndAdd 上,置信度排序写入的每组两个及以上未定位置均为依赖关系,生成分布的总变差达采样噪声下限的 29 倍,而逐样本指标仍为 1.0。
多语言自监督语音模型在相同预训练数据预算下仍落后于单语言模型,而强化预训练中的语言判别能力可缩小这一差距。
Apple 研究团队提出 RLTL;DR,让策略在每次失败后根据验证器输出自行撰写一条 TL;DR 式反馈,并将上下文中的洞察反向传播以内化“任务→洞察”映射。
Apple 与 EPFL 研究者发表论文,比较开源 SOTA MLE agent harness 与最小 harness 的单会话 coding agent。在相同时间预算和同一前沿 LLM 骨干下,复杂 harness 并无优势,性能主要取决于模型骨干;大规模消融实验显示多层机制在 coding agent 场景中变得冗余。
Apple 发布 SCLATE,一个持续学习智能体训练与评测的执行基底,基准和未修改的智能体通过适配器把事件加入同一开放事件调度器,混合模拟时钟可把一个月长的场景压缩到数小时。
Apple 研究团队系统考察了 LLM 条件控制方法在概念注入与移除场景下的表现,发现高效激活引导方法往往以流畅性大幅下降为代价。研究还发现激活引导在指令微调模型上的效果远不如基座模型,而提示词与监督微调适合概念注入却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。
Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。
Apple 研究团队针对联邦随机变分不等式(VI)优化,证明经典 Local Extra SGD 在更精细分析下可获得更紧的收敛保证,并指出其存在客户端漂移过大的固有缺陷。
Apple 研究团队提出潜空间蒸馏方法压缩流式神经音频编码器(tokenizer),以教师模型量化前的逐帧潜表示为监督目标,仅训练学生编码器做回归,并用单层仿射层吸收师生宽度差异。在 2.8 倍压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方法同时适用于独立预训练和与语言模型联合训练的 tokenizer。
Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务端标注数据锚定更新两条耦合设计轴,解决伪标签误差跨序列、跨轮次累积导致的训练发散问题。该方案在 11 组对比中 9 组优于此前最强方法,域内平均提升 20.8%、跨域提升 10.0%,缩小了与全监督联邦学习的差距。
Apple 研究团队提出 probe guidance,利用现有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,autoguidance 中的弱模型必须来自训练的低熵区域。
Apple 研究团队提出 Dynamically Scaled Activation Steering(DSAS),一种与具体方法无关的引导框架,将"何时引导"与"如何引导"解耦,按层和输入自适应调节现有引导变换的强度,仅在检测到不良行为时强力干预。
苹果研究团队提出以信息保真度重新定义视频描述质量,用多项选择问答替代传统文本匹配评估,以规避视频描述“一对多”导致的词汇不匹配惩罚。现有指标依赖生成文本与参考文本比对,且评估维度单一,难以对描述质量做细粒度分析。
Apple 提出 SimpleDesign,一个用于蛋白质序列与结构联合协同设计的生成模型,可同时理解氨基酸序列与三维结构之间的多模态关系。现有模型通常采用多阶段训练,先训练自编码器将数据 tokenize 为潜在表示,再在其上训练生成模型。
Apple 提出 DiscoSign,一种基于模块化 LLM 框架的语篇感知文本到手语 gloss 翻译方法,针对句子级系统忽略的语篇现象。该框架处理三类关键现象:空间指代消解、问答从句(QACs)等伪分裂结构,以及更多语篇要素。
Apple 提出 REFACTOR-VLA,用无监督库学习把 VLA 模型的动作序列组织成可复用的类型化运动程序,以解决 OpenVLA、π0、RT-2、RDT-1B 等单体模型在长时程多步任务上表现差、难以解释的问题。现有 AtomicVLA、AtomSkill 等技能发现方法回避了判断两条动作序列何时"行为等价"这一核心问题。
研究将 LLM 视为信息处理规则,用"信息处理差距"(偏离贝叶斯更新的程度)衡量其依据证据更新概率信念时的内部不一致性。实验表明 LLM 并非始终按贝叶斯方式更新信念,在医学、科学、法律等无唯一正确答案的复杂领域中,这种不一致会影响其理性决策。
Apple 提出 Agent Seer,可直接从工具规范(函数名、自然语言描述和带类型的参数 schema)合成 AI 智能体评测场景,无需人工编写或实际执行工具。该方法针对手工构造场景依赖领域专业知识、难以跨工具生态扩展、静态基准无法跟上 API 演进的问题。
Apple 提出基于评分标准(rubric)的奖励框架,针对开放域问答生成以检索证据为依据、按多个质量维度拆分的查询专属评分标准,在后期训练中提供细粒度监督。该方法在 composition、grounding 和 instruction-following 三个评测维度上的平均表现优于基线。
Apple 提出 PROOF-Gen,用优化数据改进工具调用能力的蒸馏流程。现有 generate-and-filter 流程只保留教师模型通过的轨迹、丢弃失败样本,导致每轮训练都遗留同样的困难场景;在 τ 2-bench 上教师模型 57% 的尝试失败,其中三分之二为 near-miss。
Apple 提出 Luce,一种将几何与 PBR 材质统一在体素化多模态 Gaussian 云中的 3D 表示,每种模态使用专门的 Gaussian 基元。该方法用变分自编码器把该表示压缩进统一的材质感知隐空间,以支持重光照并接入标准渲染管线。
IDEA Prune 提出将"先扩增预训练、再结构化剪枝"视为一体化系统,研究扩大模型预训练是否值得——即便该大模型最终从不部署。该工作聚焦结构化剪枝在 token 效率上相对从零训练目标规模模型的优势,并探讨如何优化这一扩增-剪枝流水线。
Apple 提出 STARFlow2,利用自回归归一化流与 LLM 共享因果掩码、KV-cache 和从左到右结构这一特性,将语言模型与归一化流结合,用于统一多模态生成。该工作针对现有统一多模态模型在离散 tokenization 损失视觉保真度、文本生成与扩散去噪结构不对称、以及适配生成时损害预训练理解能力等问题。
研究提出 Internalized Visual Thinking(IVT)后训练框架,通过联合优化文本预测与视觉思考,让多模态大模型在训练阶段学会视觉推理、推理时直接输出结果,从而规避 Visual CoT 生成中间推理图像带来的推理开销,尤其针对主动视频推理场景。
Apple 首次将迭代伪标签训练用于中英混说(Code-Switching)ASR,以利用无标注数据提升识别性能。该方法分三阶段:伪标签生成、两阶段双语模型训练和迭代改进,先从大规模无标注语料生成伪标签构建半监督数据集。
Apple 研究团队针对目标数据稀缺场景下的混合预训练展开研究,覆盖超过 2000 次语言模型训练运行,分析稀缺目标数据与充足通用数据的混合比例权衡。目标数据过少会导致模型对目标领域暴露不足,过多则因重复样本造成收益递减并最终过拟合。
针对目标语言训练数据稀缺时跨语言知识迁移依赖大量平行数据、翻译系统或辅助模型的问题,Apple 提出通过词汇干预(Lexical Interventions)实现多语言知识迁移。该方法面向科学推理、常识推断和世界知识等下游任务,在数据受限条件下提升从高资源语言向低资源语言的知识迁移效果。
苹果研究团队对 LLM 的类人行为展开多维分析,考察其普遍程度、潜在影响与可控性,采用 LLM-as-a-judge 与人工评估相结合的方法,覆盖 21,000 条样本。研究同时纳入模型行为、用户因素与系统提示词三个维度,旨在为研究者与从业者判断 LLM 何时以及应展现何种类人行为提供方法与实证依据。
研究证明,倒排索引上的标准查询求值策略在处理 AI 智能体编译出的深层嵌套、非单调布尔查询时存在严重理论限制。Document-at-a-Time 有状态迭代器模型受 NC^1 公式求值结构性约束,展开重收敛逻辑时最坏情况出现 O(2^|Q|) 指数级爆炸。
针对核方法最优传输(OT)估计器因依赖短步内点法(SSIPM)而迭代次数多、计算代价高昂的问题,研究者提出一种专用半光滑牛顿法。此前 Vacher 等人 2021 年的工作表明,这类估计器在高维概率测度比较中比基于线性规划的 plug-in OT 估计器更具统计效率,但计算成本极高。
一项大规模实证研究考察了 GRPO 在非英语和多语言场景下的表现,覆盖多种基座模型、训练语言和不同的推理语言奖励设置。研究发现,用母语进行推理训练与用英语推理训练之间的差距往往很小。
Apple 提出 MVICAD2,一种带延迟与膨胀的多视角独立成分分析方法,用于解决多视角场景下异构数据整合、特征空间对齐和视角特有偏差等难题。该方法面向 MEG 群体研究,在假设各受试者脑源相似的前提下估计头皮信号背后的脑源活动。
针对机器遗忘方法通常对遗忘集中所有数据点一视同仁的问题,研究者提出低影响点或许无需被移除。通过跨语言与视觉任务对比分析影响函数,他们识别出对模型输出影响可忽略的训练数据子集,从而降低遗忘计算成本。
Apple 提出 Arbitrage 方法,通过优势感知推测提升 LLM 推理效率。传统 token 级 Speculative Decoding 因语义等价步骤中的 token 不匹配导致不必要的拒绝,Arbitrage 针对这一问题进行改进。
Apple 研究团队提出 Scaling Categorical Flow Maps,将类别流映射(CFMs)扩展到更大规模,用于连续生成离散数据。该方法通过高斯分布与 one-hot 编码数据分布间的流匹配过程实现语言建模,并支持加速采样。
研究对比了扩散语言模型(DLM)与自回归语言模型(ARM)的性能表现。ARM 逐 token 顺序生成,在下游任务上准确率高,但因下一 token 预测的固有顺序依赖导致算术强度偏低;DLM 则作为新兴范式展现出潜力。
Apple 提出 DeepAmbigQA,一个面向 LLM 答案完整性的歧义多跳问答基准,并配套自动数据生成流水线 DEEPAMBIGQAGEN。该基准针对"《Heat》中哪位演员拿过至少一座奥斯卡奖"这类问题,同时考察同名作品区分与跨大量演员的推理整合能力,而现有 QA 基准很少联合评测这两项挑战。
研究提出深度低秩残差蒸馏方法,用于锁定预训练语言模型权重,防止其被未经授权地微调或改造。该方法针对开放权重模型易被适配滥用的问题,在保留模型原有能力的同时抵御下游修改。
研究揭示,现代 RAE-DiT 图像生成流程中,预训练 ViT 编码器和 DiT 去噪器都会产生高范数离群 token,后者尤其出现在中间层。这类 token 会吸引过多注意力却携带有限局部信息,此前在生成模型中的作用尚未被充分探索。