跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(3)
981 条AI 相关新闻 · 最新在前
10月1日周四
  1. Hugging Face Daily Papers32

    Spatial Memory Intelligence:用理解模型为世界模型赋予长期空间记忆

    研究者提出 Spatial Memory Intelligence(SMI),首个系统性地用理解模型为长视频世界模型管理空间记忆的框架,包含空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤四项原子操作。在多个基线、benchmark 和世界模型骨干上的实验显示,SMI 在记忆稀疏度、生成稳定性和空间一致性上均取得提升。

  2. Hugging Face Daily Papers41

    SourceLearn:让 LLM 智能体从知识访问转向来源学习

    针对 LLM 智能体反复使用同一外部来源却只当作重复访问的问题,研究者提出 SourceLearn,通过自导向来源学习和任务引导来源学习两种机制构建并持续优化持久化来源模型。在五个 benchmark 和三个 LLM 后端上,SourceLearn 在 15 个设置中的 13 个取得最佳表现,相比 Hybrid RAG 最高提升 22.6 分。

  3. Hugging Face Daily Papers42

    SimuVerity:面向工程级 Simulink 模型生成的智能体基准测试

    SimuVerity 是一个包含 101 个文本到可执行 Simulink 模型生成任务的基准,覆盖十个工程领域,从准确性、输出质量、机制保真度、控制与因果完整性、运行域鲁棒性和动态响应六个维度评估智能体。对六个智能体系统的评测显示,最佳系统总分仅 42.86,结构相似度无法代表工程性能,部分高分模型仍存在严重的视觉布局混乱问题。

  4. Hugging Face Daily Papers37

    Latent-MOPD:面向 LLM 的潜在多教师同策略蒸馏

    Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,无需额外教师训练即可同时利用专家的预测分布与隐藏状态进行监督。在同族教师设置下,它在数学、代码、逻辑共 9 个基准上全面超越仅 token、仅表征和均匀平均基线,且参数量与单个教师相同时多数基准超过最佳教师;跨族教师下也在全部基准上优于单通道基线。

  5. Hugging Face Daily Papers40

    ProWAM:用渐进式视觉规划实现世界动作建模

    ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它只需单次视频骨干前向传播缓存子目标特征,避免迭代式全视频生成。在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上 75.7%,零样本真实场景成功率 70.0%,较最强基线提升 15.0 个百分点。

  6. Hugging Face Daily Papers42

    Local Support Learning:无需旧数据即可缓解大模型灾难性遗忘

    研究者提出 Local Support Learning(LSL),一种无需访问旧数据即可在梯度训练中保留模型原有能力的通用框架,通过权重适配器与基于高斯混合模型(GMM)的门控函数配合,使更新仅作用于当前训练分布。该方法可在最高 70 亿参数的 LLM 上缓解灾难性遗忘,跨多个训练阶段同时保留预训练与微调能力,且内存与计算高效、对超参数稳健并具备扩展潜力。

  7. Hugging Face Daily Papers46

    VeriHarness:为长时程任务扩展智能体验证能力

    VeriHarness 将生成用的 LLM 变为智能体验证器,通过工作区、证据工具和可复用验证技能,对多次采样结果做分歧消解与共识挑战。在五个长时程工作区基准和两个前沿模型上,它取得最高选择分数,证据支撑的修订让 Gemini 3.5 Flash 和 Claude Opus 4.8 相比单次 rollout 分别提升 6.2 和 6.4 分。

  8. Hugging Face Daily Papers42

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,提供自然语言指令以及几何与纹理的目标图像,由确定性装配引擎在每次编辑后生成精确目标,每条序列均经人工审核。基于该基准的对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更准、更能保留未编辑部分,但每次编辑耗时数分钟。装配引擎与编辑序列将开源发布。

  9. Claude Code GitHub Releases36

    Claude Code v2.1.286 发布

    Claude Code v2.1.286 发布,权限提示新增“2 of 5”计数,全屏列表的“N more”行支持鼠标点击跳转。本次修复涵盖多进程重复打开登录浏览器、claude --resume 与 --continue 丢失并行工具调用轮次、工具返回对象或数字导致的 API 400 错误,以及云会话因容器停止而无法唤醒等问题。

9月30日周三
  1. Hugging Face Daily Papers35

    PEARL:基于推理与反思的个性化图像生成,提出首个用户历史个性化图像生成基准

    研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。

  2. Hugging Face Daily Papers34

    Diptych:面向音乐制作参考聆听的范围化 AI 解读对比系统

    Diptych 是一个 AI 辅助的音乐参考聆听对比系统,允许用户自定义对比范围——整首曲目或独立选取的片段,并查看结构化音频特征与针对该范围的 AI 解读。在 12 名音乐人参与的受试者内研究中,参与者借助该系统发现了更多差异,其中十分之九获得专家至少部分支持,同时报告了良好的可用性。研究认为,面向创意对比的 AI 支持应优先考虑用户自定义范围、可检查的证据和可操作的指引。

  3. Hugging Face Daily Papers35

    JEPA-TTT:面向动态变化下规划的潜世界模型持久测试时训练

    JEPA-TTT 在测试阶段持续自适应预训练动作条件 JEPA 世界模型的潜动态预测器,自监督更新跨回合累积,视觉编码器与奖励头保持冻结,规划无需目标图像或在线环境奖励。方法采用密集回放,在每个时间偏移构造预测窗口并存入增长缓冲区采样更新。在四个连续控制环境的八种动态变化下,500 个测试回合后自回归潜预测误差平均降低 83%,规划性能较冻结 JEPA 世界模型提升 153%。

  4. Hugging Face Daily Papers31

    JevSpawn:通过组合式动作空间实现自适应智能体推理

    JevSpawn 是一种组合式策略,将自然语言任务描述与有限域概率探索连接起来,通过并行动作生成配合反馈驱动的分支选择、表示修正和备选方案恢复,在无需额外训练的情况下减少重复生成与上下文计算。在八项基准任务上对比七种智能体基线和一种 TypeSafe Jev 变体,JevSpawn 取得了更优的任务表现和更快的导航速度。

  5. Hugging Face Daily Papers58

    arXiv 论文揭示非侵入式脑到文本解码中的时间捷径并提出 SimpleB2T

    研究发现非侵入式脑信号解码单词的主要性能提升可在无脑数据时复现,固定长度窗口重叠隐式泄露词间时长信息,合成无脑信号达 22.0% balanced accuracy,接近真实脑记录的 22.3%。作者改为独立处理各窗口以消除该捷径,提出的 SimpleB2T 在感知语音基准上达到 36.6% 词错率(每词五次观测)。

  6. Hugging Face Daily Papers43

    自回归 Transformer 如何从局部观测外推混沌系统的全局动力学

    小型自回归 Transformer 仅用受限参数区间的轨迹训练,就能在训练分布之外的闭环评估中复现倍周期分岔、混沌动力学和吸引子结构。在 logistic 映射上,模型复现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。研究还通过因果干预揭示了控制参数信息经注意力机制影响状态预测与闭环动力学的路径。

  7. Hugging Face Daily Papers43

    让 AI 审稿人更可信:RobustReview 基准与 SciCore 审稿模型

    研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。

  8. Hugging Face Daily Papers45

    BeyondSCe:面向事件指代抓取的主动视角选择零样本机器人系统

    零样本机器人抓取系统 BeyondSCe 可依据目标在过往事件中扮演的角色而非名称或外观来定位并抓取,目标被遮挡时结合事件先验与当前场景几何主动选择视角。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%;在四个重度遮挡场景中成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。

  9. Hugging Face Daily Papers35

    邻近监督更优:Neighborhood OPSD 自蒸馏方法提升数学推理模型性能

    Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。

  10. Hugging Face Daily Papers33

    PhysVista:通过感知-推理-评估闭环基准测试VLM的物理智能

    PhysVista提出一个闭环认知框架基准,联合评估视觉语言模型的物理状态感知、物理动态推理与物理合理性判断,并区分事件级与尺度级推理。该基准同时纳入真实世界与AI生成视频,覆盖多样领域与新兴生成场景。对多种VLM的实验显示,模型在物理推理与合理性评估上存在显著局限,视觉识别与真实物理理解之间仍有明显差距。该研究被NeurIPS 2026主会议接收。

  11. Hugging Face Daily Papers36

    SemanTok:面向高效自回归视频生成的可预测语义 token

    SemanTok 是一种灵活视频 tokenizer,将冻结的 DINO 特征输入编码器,并用轻量 head 从每个保留的 token 前缀单独重建这些特征。201M 的 SemanTok AR 模型在保真度上追平或超过 3.4 倍规模的 VideoFlexTok AR 模型,更大模型还能进一步提升保真度。它在分布外类别上保持语义对齐,并在包括纯噪声在内的每个噪声水平上为解码器提供更高的语义对齐。

  12. Hugging Face Daily Papers39

    LEAP:面向长音视频感知的学习式分块证据检索框架

    LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。