跳到正文

全部动态

今日 24 条
9月29日周二
  1. Latent Space76

    AMD 以 82 亿美元收购 World Labs,其 Atlas 模型解决稀疏重建问题

    AMD 收购李飞飞创立的空间智能公司 World Labs,因 AMD 是上市公司,收购价格 82 亿美元得以确认。World Labs 发布的 Atlas 是从零训练的全域模型架构,能从 2D 图像输入预测下一个视角,结合生成模型与多视角几何解决了计算机视觉中长期存在的稀疏重建问题,应用于机器人 RL 环境、场景生成和房产设计等领域。

    推荐理由:原文补充了公开公司可查的收购价格,并梳理 Atlas 的稀疏重建能力,读者可了解这笔交易背后的技术底细。

  2. clem 🤗77

    AMD 宣布欢迎 World Labs 和李飞飞加入 AMD,双方计划结合 World Labs 在 AI 与世界模型方面的专长与 AMD 的算力能力,推动 AI 未来并强化开放 AI 生态。Hugging Face CEO Clément Delangue 转发该消息并祝贺,期待双方未来数年的成果。

    引用Lisa Su@LisaSu

    So excited to welcome @theworldlabs and @drfeifei to the @AMD family! I’ve always been a huge fan of Fei-Fei and her pioneering research in AI. Together, we’ll combine World Labs’ deep expertise in AI and world models with AMD’s compute leadership to power the future of AI and strengthen the open AI ecosystem. Can’t wait for all we’ll accomplish!

    推荐理由:AMD 收购 World Labs 与李飞飞的消息结合 World Labs 专注世界模型与开放生态的定位,读者可了解这次结合对 AI 开源生态的影响。

  3. elsewhere articles54

    Manus 2.0 发布并推出个人智能助理 Cue

    9 月 28 日 Manus 面向海外用户发布 2.0 版本,并推出面向个人生活场景的智能助理 Cue。上线不到 12 小时,用户已用其打电话、做机器人游戏、多 Agent 协作规划迪拜旅行等。Cue 中每个 Agent 可拥有自己的邮箱、电话号码、钱包和电脑,代表用户与现实服务交互,多 Agent 可进群聊点餐取号;Manus 正在组建团队开发国内市场产品。

  4. Hugging Face Daily Papers41

    Tacit-TTS:从自回归解码到掩码预测的高效无转写语音克隆

    Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在四个中英文数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,同时保持有竞争力的零样本质量。无转写条件还支持跨语言及非词汇参考,如其他八种语言、婴儿咿呀声和合成乱语。

  5. Hugging Face Daily Papers36

    FlexRouter:为灵活 LLM 路由学习互补模型集合

    FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。

  6. Hugging Face Daily Papers36

    RASO:通过跨 Harness 适配的检索增强技能优化

    研究者提出检索增强技能优化框架 RASO,利用外部技能语料库作为先验知识,通过跨 Harness 适配解决领域与 Harness 不匹配问题。RASO 包含无需 agent rollout 即可构建初始技能的 RASI,以及依据执行反馈迭代优化技能的 RASU 两个阶段。在四个 agent benchmark 和两个模型上,RASO 持续优于无检索增强的基线方法。

  7. Hugging Face Daily Papers35

    音频-视觉大语言模型中的“问题接力”机制与 SECRET 去幻觉方法

    音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。

  8. Hugging Face Daily Papers40

    LoopVL:循环视觉智能

    LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。

  9. Hugging Face Daily Papers38

    NEEDLE:通过权重正交化移除 LLM 后门

    NEEDLE 提出一种无需训练的后门移除方法,在识别触发词后,通过激活向量估计后门方向和拒绝子空间,并应用顺序权重正交化来抑制后门,同时防止拒绝相关表征发生变化。该方法无需干净参考模型或原始中毒训练数据。在多个模型家族和攻击类型上的评估中,NEEDLE 取得了最低的平均攻击成功率(ASR),在具有挑战性的代码注入攻击上达到 0%,且 KL 散度最低,能力和安全性变化最小。

  10. Hugging Face Daily Papers36

    TERRA:面向肌肉骨骼运动的地形感知重建、重定向与控制

    TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据恢复支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。

  11. Hugging Face Daily Papers42

    RLE-Bench:面向机器人学习工程师的编码智能体资格考试基准

    研究者推出 RLE-Bench,一个覆盖交互控制、策略学习、感知与估计、机械设计四类机器人开发工作流的基准,用于评估编码智能体的工程能力。该基准按任务特定指标评估智能体提交的产物,并汇总为 RLE Index,同时给出各工作流的能力画像。论文还通过案例研究分析了智能体在代表性任务上的表现与局限。

  12. Hugging Face Daily Papers33

    E-MoE:面向非因子化扩散语言模型的增强型混合专家架构

    E-MoE提出将反向生成过程构建为基于MoE骨干网络专家路由决策的离散共享隐变量上的因子化分布混合,在不增加活跃参数的前提下提升少步生成质量。在合成多模态基准、二值化MNIST和LM1B上,E-MoE均优于因子化基线模型,缓解了掩码扩散模型在少步场景下因位置因子化导致的样本质量限制。

  13. Hugging Face Daily Papers32

    自注意力在竞争下的检索容量研究

    研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的有效注意力集合大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小但其占上下文比例下降,对保留权重重新归一化可大幅缩小该集合。

  14. Hugging Face Daily Papers45

    Prompt2Skill:仅凭自然语言指令实现无监督技能优化

    Prompt2Skill 是一个仅凭自然语言任务描述即可构建技能的无监督框架,能从提示词中推导任务规范、发现或合成数据集,并通过反思式编辑闭环迭代优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架平均提升 10.8 分,持续优于直接提示基线。

  15. Hugging Face Daily Papers33

    CorrGRPO:面向多奖励学习的相关性归一化 GRPO

    CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。

  16. Apple Machine Learning Research45

    Apple 研究:语言模型树结构表达式序列化的通信瓶颈

    Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。

  17. Hugging Face Daily Papers42

    针对黑盒 LLM 的受控解码攻击

    研究者提出受控解码攻击框架,可在仅返回采样文本的黑盒 LLM 接口上绕过安全对齐。该方法通过采样分布重建、风险门控残差控制和推测式多 token 执行,将采样成本集中在少数关键位置。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。