跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(6)
1,686 条AI 相关新闻 · 最新在前
9月2日周三
  1. Hugging Face Daily Papers41

    Control-Data Flow Separation:多智能体 LLM 的稳定提示词优化方法

    针对多智能体 LLM 系统中提示词同时承担内容生成与执行协议两种角色、优化时易破坏路由与格式协议的问题,研究者提出 control-data flow separation,将执行关键的控制逻辑表示为带类型、可验证的程序对象,任务相关语言则保留为可优化的数据流。在合成推理、协作评审生成和保险评级三类工作流中,该框架实现 100% 最终协议有效性,并持续提升任务表现。

  2. Hugging Face Daily Papers42

    DroneCATS 基准评估多模态 LLM 作为无人机控制通用视觉-语言-动作智能体

    研究者提出 DroneCATS-Agent 架构与 DroneCATS 基准,将 MLLM 直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标及多无人机编队指挥四项能力,模型规模下探至 2B 参数。结果显示小型开源模型常比前沿模型更可靠地进入成功半径,却因过早或未声明到达而失败,多机指挥中还会盲目复制单一坐标。

  3. Hugging Face Daily Papers41

    原生统一多模态模型中的理解-生成协同:从表征、任务到系统

    研究在无预训练视觉先验的原生统一多模态模型中发现,理解与生成在表征层面可互相提供有用信号,但强制走同一计算路径会导致一方主导。任务解耦架构在保留语义交互的同时专门化冲突的视觉计算,可避免这种不对称退化。系统层面,端到端统一多模态模型在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。

  4. Hugging Face Daily Papers32

    ReFlowSET:面向 SAR 到 EO 图像翻译的表征对齐潜空间流匹配框架

    ReFlowSET 是一种条件潜空间流匹配框架,通过联合 SAR-EO 重建审计来选择编解码器,并在选定潜空间中从零训练更小的条件 DiT,配合双流 SAR 条件与联合特征精炼。训练时用冻结视觉基础模型提取的干净 EO 表征对齐中间噪声 EO 特征,不增加推理成本。在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与预训练权重已公开。

  5. Hugging Face Daily Papers46

    GUI-CC:将 GUI 世界模型作为智能体环境评测其上下文一致性

    研究者推出 GUI-CC 基准,用于评测 GUI 世界模型作为智能体环境时的上下文一致性,而非单步下一屏预测。该基准包含离线参考动作与在线智能体循环两条赛道,基于 GUIOdyssey 构建 500 个离线轨迹任务,并在 30 个移动应用中构建 200 个经模拟器验证的在线任务,评测转换保真度、转换合理性、上下文一致性与任务进度。

  6. Hugging Face Daily Papers36

    安全防护生效了,LLM 系统就更安全吗?——部署视角下的防护评估标准

    一项 arXiv 研究指出,当前 LLM 服务的安全防护多以拒答率、攻击成功率和违规率来评估,但这些指标只反映防护在测试请求上的局部表现,无法回答部署后攻击者持续适配或另寻入口时系统仍会提供多少有害帮助。研究认为,证明有害帮助仍存在只需一次成功攻击,而要证明其已很少则必须补充防护之外整个系统的证据,这类证据在深度编码的论断中仅占少数。因此局部分数提升本身不等于部署更安全。

  7. Hugging Face Daily Papers38

    RECAP-Forcing:按内容新颖度组织记忆的长视频生成方法

    RECAP-Forcing 提出按"外观新颖度"而非时间远近组织记忆,在内容首次出现时保留其对应 KV cache,让记忆规模随新增内容量而非视频长度增长。该方法统一了注意力汇与基于光流的新颖度库两种机制,作为无需训练、不增加可学习参数的推理方法,在多个强基线上持续提升视觉质量与语义保真度,并优于现有记忆方法。

  8. Hugging Face Daily Papers35

    CoVA-SFT:大规模视觉抽象链数据集发布

    研究者发布 CoVA-SFT,一个包含 51.9K 样本、超 222K 多模态推理步骤的视觉抽象链数据集,覆盖 5 种布局家族和 17 项复杂任务,并配套 1,700 条测试样本的 CoVA-Bench 基准。在该数据集上微调的模型在 CoVA-Bench 上平均超过所有交错 CoT 基线 2 倍以上,但仍落后于强纯文本 CoT 基线。该数据集已被 EMNLP 2026 Findings 接收。

9月1日周二
  1. Hugging Face Daily Papers42

    MMMMM:一个用于研究多语言多模态虚假信息机制的统一分类体系

    研究者构建了来自 Twitter/X 七种语言的大规模真实虚假信息数据集,并提出多模态虚假信息分类体系,通过 VLM 自动化多步标注流程完成分类落地并经人工验证。分析发现,AI 生成内容在科技领域尤为普遍,而疫苗虚假信息则大量借用新闻媒体图片以增强可信度。该方法和发现为针对性检测多模态虚假信息提供指引,并建议缓解措施应策略性地差异化应用而非统一实施。

  2. Hugging Face Daily Papers33

    SpanCalib-VLM:视觉语言模型中的校准幻觉片段检测

    SpanCalib-VLM 提出一种双系统混合方案,用于视觉语言模型的幻觉片段检测:将 XLM-RoBERTa-Large 与 SigLIP 视觉编码器经交叉注意力融合的多模态序列标注器,与微调生成式 VLM(Qwen3.5-4B-SHROOM-SFT)结合,通过 Union-Calibrated Fusion 策略用标注器的校准概率对生成模型的候选片段重新打分。

  3. Hugging Face Daily Papers33

    DICS:面向视觉指令筛选的数据内在一致性方法

    研究者提出数据内在一致性(DIC)自评分指标及基于它的自适应数据筛选方法 DICS,在样本级一致性与全局分布多样性之间做权衡。DICS 仅用 25% 的 LLaVA-1.5-665K 数据即超过全量微调,并构建了 600 万样本的 DICS-6M 多模态指令语料。在不足 InternVL3-8B-Instruct 官方训练数据 25% 的情况下,DICS 达到其 94.52% 的性能。

  4. Hugging Face Daily Papers34

    PaperBanana-Interact:用多轮人类反馈精修科学图表

    针对科学图表生成中单轮难以满足作者偏好的问题,研究者提出多轮图表生成基准 MTPaperBananaBench,含 292 张图像和 3,518 条用户需求,并构建用户模拟器将未满足需求转为自然语言反馈。基于此提出的多智能体系统 PaperBanana-Interact 通过内部批判-精修循环,在多轮中持续提升图表质量,质量分超越基线 11.9-18.6 分,遗忘问题减少 3.7-6.2 分。

  5. Hugging Face Daily Papers41

    Lucida:面向可组合真实到仿真场景建模的解析、生成与放置框架

    Lucida 提出一种可组合场景建模框架,将真实室内视频解析为带多视角证据的场景图,为每个实例生成完整资产,并用 VLM 策略 GizmoAct 以多轮 GUI 交互方式闭环放置物体。在 R2S-Scene 上其 mAP 较 Boxer 提升 69%,CA-1M 上 ADD-SB@0.05 从 57.8% 升至 83.4%,场景 F-Score 从 SAM3D 的 0.794 提升至 0.924。

  6. Hugging Face Daily Papers30

    DIEM:面向强化微调的动态重要样本挖掘框架

    研究者提出 Dynamic Important Example Mining(DIEM),一个全自动的强化微调数据利用框架,通过梯度对齐重要性估计器近似每个样本对策略改进的边际贡献,并用约束批重加权方案在保持更新梯度幅度的同时最大化总体效用。在多个推理基准上,DIEM 持续优于强静态与动态基线,代码将通过论文链接发布。

  7. Hugging Face Daily Papers42

    SHAPE:用数学教育视角解析 LLM 数学推理的思维链

    研究者提出 SHAPE 框架,从语义空间与启发式两个数学教育视角分析 LLM 的 Chain-of-Thought 轨迹,发现模型采用的数学启发式比传统 CoT 特征更能解释最终答案正确性,且模型倾向集中在少数语义空间内推理。研究还发现强化学习会导致启发式使用出现模式寻求,而通过后训练促进启发式多样性可提升数学推理准确率。

  8. Hugging Face Daily Papers43

    MineAmongUs:VLM 智能体在具身社交中的言语与非言语欺骗

    研究者推出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗队友,同时提出可配置 VLM 智能体框架 ARIA,暴露五条认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融与跨 VLM 评测中都是更决定性的获胜因素。该工作为具身 VLM 智能体对齐研究开辟了新路径。