跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(5)
1,080 条AI 相关新闻 · 最新在前
9月11日周五
  1. Hugging Face Daily Papers49

    SenseNova-U1.5:迈向原生统一视觉智能

    SenseNova-U1.5 发布,这是一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构下实现视觉内容的理解、推理与生成。模型支持最高 4K 原生分辨率,并通过多专家 on-policy 蒸馏优化视觉美学、双语文字渲染、信息图生成与图像编辑等能力。官方将开源训练代码,涵盖监督微调、强化学习与 on-policy 蒸馏。

9月10日周四
  1. inclusionAI Hugging Face models48

    蚂蚁 Ling-3.0-flash-Fin 发布:124B 参数金融增强模型,256K 上下文

    蚂蚁集团推出 Ling 家族首个金融增强模型 Ling-3.0-flash-Fin,总参数 124B、激活参数 5.1B,支持 256K 上下文窗口。该模型基于 Ling-3.0-flash 用高质量金融数据继续训练,覆盖端到端金融研究、多文档推理与估值建模,并同步开源 FinFIRST 评测集。当前以 BF16 发布,兼容 SGLang 与 vLLM,默认开启思考模式。

  2. Hugging Face Daily Papers35

    Brain2Semantics2Text:用语义表征突破非侵入式语音解码瓶颈

    研究者提出 Brain2Semantics2Text,通过中间语义嵌入空间重建文本,将句子级 MEG 响应映射到语义流形后再反演为自然语言,无需词级对齐即可恢复高层语义。该方法针对非侵入式神经记录信噪比低、难以细粒度重建音素或单词的问题,与既有非侵入式 Brain2Text 方法相比在句子级结果上取得提升。

  3. Hugging Face Daily Papers46

    AgentGrad:面向多智能体系统的干预引导提示词优化框架

    AgentGrad 是一个面向 LLM 多智能体系统的提示词优化框架,通过顺序干预逐个修改智能体行为以定位导致失败的目标智能体,并用其输出作为智能体级监督提取细粒度文本梯度。该方法还通过语义文本梯度抽象对相似梯度聚类,避免混合无关失败模式。在五个 MAS 基准上,AgentGrad 达到 SOTA,优化耗时降低 2.5 倍,优化成本平均降低 21.8%。

  4. Hugging Face Daily Papers34

    OracleZoom:基于在线策略自蒸馏的参考约束递归图像超分辨率

    OracleZoom 是一个受在线策略蒸馏启发、带参考约束的递归图像超分辨率框架,通过在训练轨迹上保留最后一次真实标注证据来监督更深层预测。它在七个数据集上取得 SOTA 超分质量,平均 CLIPIQA 达 0.713,深层放大尺度收益更大,并显著减少模型幻觉。代码、数据与模型均已开放。

  5. Hugging Face Daily Papers33

    视频为何仍然如此昂贵?视频与音视频 LLM 推理效率机制综述

    一篇综述系统梳理了 VideoLLM 的推理效率机制,覆盖帧采样、模态编码、连接器层 token 压缩以及 LLM 预填充与解码各阶段的瓶颈。研究按方法作用的流水线阶段进行归类,涵盖 2022 年底以来的 VideoLLM 及更早的帧采样与视觉编码器机制,并汇总了共享宿主模型与输入协议下的精度—成本对比,指出音视频效率与标准化评测仍存空白。

  6. Hugging Face Daily Papers39

    HybridAL:主动学习中基于稳定信号的训练策略切换

    HybridAL 是一种自适应训练调度方法,通过监测在线稳定信号,在模型轨迹持续稳定后从重新训练切换为微调。在三种编码器骨干和六个文本分类任务上,HybridAL 的端点 macro-F1 与重新训练和微调相比不劣于 0.010 的差距,最多节省 49% 的重新训练时间,并恢复了重新训练在 NLL 校准上的大部分优势。相比固定轮次切换,它在中度额外成本下获得更低的 NLL。

  7. Hugging Face Daily Papers56

    DF26 基准:人类与主流检测器已难以分辨 AI 生成视频

    研究团队提出 DF26 基准,用于检测由近期文本到视频和图像到视频模型生成的合成视频,视频为单人公开演讲场景,包含 271 条真实视频与 2,420 条合成视频,合成视频由七个现代视频模型生成。基于 DF26 的研究显示,人类识别 AI 生成视频的表现以及当前最先进的 deepfake 检测器都接近随机水平。研究指出当前评测协议存在局限,需要能明确衡量对现代生成模型分布偏移鲁棒性的基准。

  8. Hugging Face Daily Papers46

    SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究?

    研究者提出 SAEScientist-Bench,用于评估 AI 智能体能否像科学家一样使用 SAE 工具自主完成机制可解释性发现。任务要求智能体在 Gemma-2-9B-IT 的 Gemma Scope 词典中检索 131K+ 特征,并与 Neuronpedia 上的专家参考特征对比激活排名、对比文本上的概念选择性和因果引导效果。

  9. Hugging Face Daily Papers39

    RESCUE-BENCH:面向关系感知多方情感支持对话系统的基准

    研究者构建了 RESCUE 基准,用于评估 LLM 能否捕捉并利用多人关系中不断变化的动态来提供情感支持。该基准取自真实情侣与家庭访谈对话,包含 191 个样本、7,079 个标注轮次和 1,064.8 分钟视频,定义了关系理解与关系敏感支持两类能力下的六项任务。对十款 LLM 的实验显示,模型在依赖局部情绪线索的任务上表现尚可,但在关系模式预测、观点预测和支持策略预测等关系密集型任务上表现不佳。

  10. Hugging Face Daily Papers43

    Φ-Bench:大语言模型能否工程化支撑自身运行的基础设施?

    研究者提出 Φ-Bench,用于系统评估 LLM 工程化 LLM 基础设施栈的能力,覆盖从局部 kernel 级函数补全到长周期实现与端到端系统优化等不同复杂度任务。该基准源自前沿研究中的优化问题并基于真实代码仓库构建,弥补了现有基准仅关注孤立 kernel、预定义算子或预设优化目标的不足。对前沿 LLM 的实验揭示了其在工程化复杂 LLM 基础设施上的现有能力与局限。

  11. Hugging Face Daily Papers46

    重新审视后训练中的完整推理轨迹:部分轨迹与端点训练即可奏效

    研究发现,LLM 后训练(如 SFT)中完整推理轨迹带来的收益有限,而部分轨迹即使被大幅截断仍然有效。基于注意力的分析和受控 token 移除实验表明,中间 token 对最终推理质量贡献极小,模型可依据已知轨迹端点从内部知识推断缺失步骤。仅用端点训练还能改变推理行为,并提升基于强化学习或 on-policy 蒸馏的后训练方法效果。