跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(3)
981 条AI 相关新闻 · 最新在前
今天10月6日周二
  1. Hugging Face Daily Papers43

    InterMimicGen:通过自演化动作模仿扩展人形机器人全身移动操作

    InterMimicGen 是一个自演化动作模仿框架,让机器人动作数据与跟踪策略相互促进:先将动捕人-物交互数据集重定向为人形机器人参考动作,再训练基于物理的通用跟踪器在仿真中执行,并通过数据飞轮对交互位置和身体执行方式做保持任务语义的小幅修改,仅保留仿真执行成功的变体用于下一轮迭代。

  2. Hugging Face Daily Papers41

    循环模型如何做对(第二部分):在不动点处重新思考

    循环语言模型的每次循环都会增加训练、解码、prefill 和 RL 成本,而循环状态越接近不动点,到达它的路径就越不重要。研究改进了塑造不动点的两个训练组件——深度先验与输入注入:从预测反馈中学习先验并用熵项保持其宽度,用正交注入移除状态沿输入方向的分量。

  3. Hugging Face Daily Papers47

    通过校准内容认证实现真实图像认证

    研究评估二十款深度伪造检测器对抗近四年发布的十款生成器,准确率从99.5%降至76%,对抗扰动可将所有基线检测器降至2%以下。作者提出一种校准检测范式,输出真实性是否可合理否认的预测,可将误认证生成内容控制在1%以内。对3000张Reddit图像,2022年生成器无法复现1116张,2024年生成器仅55至79张无法复现。

10月4日周日
  1. Claude Code GitHub Releases34

    Claude Code v2.1.289 发布

    Claude Code 发布 v2.1.289,修复了复合 shell 命令嵌套部分的 deny/ask 规则在托管机器上无法覆盖用户安装 mod 审批的问题,并解决了短代码块含大量未闭合标签或深层嵌套 ${ 替换时终端卡死的问题。该版本还回退了 2.1.288 中可能导致更频繁登出的 claude auth status 改动,并新增 agent.spawn 等插件能力。

  2. Hugging Face Daily Papers40

    ASCENT:通过自蒸馏验证经验实现在线测试时训练的长程智能体

    ASCENT 提出一种在线智能体测试时训练方法,让 LLM 在部署过程中用自身执行轨迹更新权重,通过将验证过的轨迹作为特权信息自蒸馏进持久 LoRA 快速权重,无需外部参考解或更强教师模型。在 ALFWorld、WebShop 和 AppWorld 上,ASCENT 随经验积累提升任务成功率与交互效率,优于在线适应方法,并可迁移到未见场景。

  3. Hugging Face Daily Papers42

    MemAdapter:对抗记忆诱导谄媚的反事实自适应框架

    MemAdapter 框架通过反事实归纳、上下文感知反思和基于证据的推理三个组件,自适应整合检索到的记忆,解决 LLM 智能体因长期记忆而产生的谄媚问题。该研究指出,即使记忆本身客观正确,也可能在不同语境下诱导谄媚行为,而现有方法仅通过过滤偏差记忆来缓解风险。在三个基准测试上,MemAdapter 持续提升了记忆可靠性,代码已开源。

  4. Hugging Face Daily Papers37

    Prism:面向原生 2K 音视频联合生成模型训练的动态稀疏注意力

    针对原生 2K 分辨率音视频联合生成模型训练中全注意力二次开销大、冗余 token 稀释学习信号的问题,研究者提出动态稀疏注意力框架 Prism。它将 token 序列组织为时空宏区,结合视频特征方差与音频到视频交叉注意力估计局部信息结构,为每个区动态分配块形状,并采用混合块选择策略确定逐 query 稀疏度。实验显示 Prism 相比全注意力实现 2.5 倍训练加速,且生成质量更优。

10月3日周六
  1. Hugging Face Daily Papers38

    PerturBot:用扰动训练打破视觉-语言-动作模型的捷径先验

    针对视觉-语言-动作(VLA)模型依赖"模态捷径"的问题,研究者提出 Perturbot 训练方法:通过任务保持的手腕视角扰动、加入决策相关描述丰富指令,并混入随机与失败轨迹片段并按其真实行为重新标注,在不改变推理的前提下让任务证据更易被使用、捷径不再充分。同时提出离线指标 GroundingFscore,用于诊断策略对模态捷径的依赖程度,与任务成功率互补,判断模型扩展是否健康。

  2. Hugging Face Daily Papers40

    PaLoRA:面向持续学习的节奏化低秩适配方法

    针对 LoRA 持续学习中固定小学习率缺乏理论指导的问题,研究者提出 PaLoRA,通过自适应 SVD 截断压缩历史知识、将梯度投影到先前任务的零空间,并按秩感知方式自适应调节梯度步长。该方法在 50 任务的 ImageNet-A 和 ImageNet-R 基准上取得 4% 的准确率提升,长周期场景下表现尤为突出,论文已被 NeurIPS 2026 接收。

  3. Hugging Face Daily Papers43

    ALoDLM:自适应循环扩散语言模型,用 token 级计算分配缩小与 AR 模型的质量差距

    ALoDLM 通过 token 自适应潜在循环替代均匀计算,按 token 难度分配算力,在 1.7B 和 8B 两个参数规模、十一个基准上平均得分超过所有评测的扩散语言模型及对应 AR 基线。该方法将 token 级计算调度建模为潜在变量并推导条件 NELBO,同时保留快速并行解码,在优化推理引擎下取得更优的质量-效率权衡。

10月2日周五
  1. Hugging Face Daily Papers35

    泛化即稳定性而非准确性:LLM 的多轴评估

    一项研究提出以稳定性为核心的泛化评估框架 SAGO,在单样本层面、多输入变体及多行为维度上衡量 LLM 对同一输入的行为变化,而非仅看基准准确率。结果显示,许多常用模型存在统计显著的泛化不稳定:没有模型能均匀泛化,行为轴捕捉到独立失败模式,跨数据集变化甚至可能逆转模型排名。该论文已被 NeurIPS 2026 的 TAE 研讨会接收。

  2. Hugging Face Daily Papers40

    Latent-Foresight:为潜在世界模型端到端学习可预测表征

    Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于流的生成动力学模型,显式塑造表征以支持时间可预测性。实验表明,该方法能学习到时间上更连贯的潜在表征,在多项未来场景理解任务与预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已开源。

  3. Hugging Face Daily Papers42

    LOCI:面向流式世界模型的空间线性记忆架构

    LOCI 是一种混合空间记忆架构,在部分 Transformer 块中保留键值缓存,其余块则结合基于投影相机几何的循环线性注意力记忆,使视角同时参与记忆寻址与内容存储。在 MIND 基准与真实轨迹上,LOCI 比代表性世界模型及同配置全 softmax 模型更忠实地重现重访内容;保留完整历史时,同等长度下峰值内存降低约 30%。在有限记忆预算下,它还能以恒定内存流式处理长视频。

  4. Hugging Face Daily Papers43

    视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征

    视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。

  5. Hugging Face Daily Papers38

    AgSpec:突破检索式推测解码在编码智能体流水线中的极限

    AgSpec 框架为编码智能体流水线补齐检索式推测解码缺失的语料库与草稿长度策略,从会话、工作区和全局语料检索,并按智能体离线画像设定草稿长度上限、在线自适应调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器及 EAGLE-3,批大小 1 和 16 时生成吞吐量较自回归解码分别提升最高 4.37 倍和 4.76 倍。

  6. Hugging Face Daily Papers47

    Omni-Embed-Mini:通过密集蒸馏绑定多模态而不遗忘文本

    Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。