跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(5)
1,108 条AI 相关新闻 · 最新在前
9月5日周六
  1. Hugging Face Daily Papers45

    RoboTok:面向人类演示检索与灵巧操作学习的互联网级数据引擎

    RoboTok 是一个可扩展数据引擎,用查询人类操作视频从互联网视频中检索与操作相关的演示,用于训练灵巧机器人策略。它从 3D 手部轨迹学习潜在运动空间,可跨视角、场景外观和遮挡变化比较操作行为,并支持高效索引检索。真实机器人实验中,RoboTok 引导的策略相较最强基线平均成功率提升 42.2 个百分点。

  2. Hugging Face Daily Papers55

    论文定位 RLVR 解空间收窄位置:损失集中在推理入口

    一篇论文定位了 RLVR 收窄解空间的位置,在对 Qwen2.5-3B 的 PPO 与 GRPO 训练中,解法覆盖率最多下降 67%。研究发现收缩集中在推理轨迹入口,首个算术操作前的每 token 似然偏移是后续推理的 11 到 16 倍,仅提供未被选中的入口前缀就能把低覆盖家族的完成率从 0.018 提升到 0.212。

  3. Hugging Face Daily Papers43

    DRACO:用动态评分标准为长时程智能体训练做细粒度信用分配

    DRACO 提出一种基于动态评分标准(rubric)的信用分配方法,用于无真值成功信号的长时程智能体训练:训练中动态生成 rubric 以跟踪策略能力变化,每条完整轨迹评分一次,再将判断以闭式解重新分配到各步骤,在 GRPO 中产生差异化的逐步优势,且不引入额外训练归因模块。

  4. Hugging Face Daily Papers43

    Last Translation Benchmark:用人工校验规则击破领先机器翻译模型

    研究者推出 Last Translation Benchmark(LTB),收录经人工撰写与同行评审的文本、图像、音频、视频样本,专门用于击破领先机器翻译模型。每个样本附带手工编写的校验规则,描述该样本上的具体失败情形,从而支持可靠且可操作的评估。该基准为持续接收投稿的实时数据集,最新版本 LTBv1 收录 2026 年 9 月 1 日前接受的贡献。

9月4日周五
  1. Hugging Face Daily Papers34

    QCell:重组与对齐细胞查询的重叠实例分割模型

    QCell 是一种基于查询的显微镜重叠细胞实例分割模型,通过实例重组模块在潜空间分解并重组查询表示,并用对比查询对齐目标分离重叠细胞查询。在 ISBI2014 上,QCell 比 SOTA 方法提升 +2.2 AP 和 +2.7 AJI,同时提出新的 Organoid 重叠细胞分割基准。该工作已被 BMVC 2026 接收,代码、模型与数据集均已公开。

  2. Hugging Face Daily Papers47

    AutoTraceGT:用扎根理论大规模分析智能体行为

    研究者提出 AutoTraceGT,首个将社会科学扎根理论自动化应用于智能体轨迹分析的多智能体流水线,通过开放式、轴心式与理论式编码迭代至饱和,为每个任务生成定制化行为分类体系。在六个轨迹语料库上,其生成的编码手册覆盖人工标注分类体系中 73%-91% 的失败模式,并发现后者遗漏的新模式。该编码手册作为演绎特征空间时,在下游失败预测任务上优于零样本和少样本 LLM 基线。

  3. Hugging Face Daily Papers37

    SGD 优化中的渗流动力学:方差级联与离散尺度不变性

    研究将随机梯度流(SGF)建模为渗流过程,发现嵌套架构对称性迫使子网络以离散块形式合并,而非单边连接,这种结构转变在宏观序参量上表现为方差尖峰。作者进一步给出 Adam 和 AdamW 在重尾梯度噪声下捕获论证成立的充分条件,并在训练好的 Transformer 上进行了测量。

  4. Hugging Face Daily Papers39

    PACE:评估模型能否识别用户请求中的隐藏冲突

    研究者提出 PACE 数据集,用于评估模型能否识别以自我中心知识或事件形式存在的潜在约束,从而判断看似合理的用户请求是否不当。PACE 将基于明确人设的用户请求与自我中心 KB 事实配对,要求模型整合上下文证据判断请求是否冲突。同时提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索关键证据,在 PACE 上的证据检索质量和冲突决策准确率均持续优于现有方法。

  5. Hugging Face Daily Papers47

    Puffin-World:以原生 3D 世界状态扩展统一多模态模型

    Puffin-World 是一个统一多模态架构,无需外部离线模块即可整合物理理解、空间模拟与 3D 世界生成和重建,联合建模物理(重力场与纬度)、几何(深度)、外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示。团队构建了含 1500 万视觉-语言-相机三元组和 100 万条轨迹的 Puffin-16M 数据集,并已开源代码、模型与数据集。

  6. Hugging Face Daily Papers58

    Principia:面向视频模型的关系物理测试基准

    Principia 是一个通过配对物体间关系一致性来评测视频模型牛顿物理推理的基准,涵盖重力、弹性、摩擦、转动惯量、抛体、动量、单摆和弹簧振子八种现象,并使用与相机标定无关的一致性评分。在六个主流视频生成模型的数千次生成结果中,没有模型得分超过 0.42,而它们在同一批评测中 VBench 得分约 0.8。视觉语言模型检测关系物理违规的最佳准确率仅为 67%,多数接近随机水平。

  7. inclusionAI Hugging Face models68

    inclusionAI 开源 6B 图像生成与编辑模型 LLaDA-Image 及 Turbo 版本

    inclusionAI 开源 LLaDA-Image 图像生成与编辑模型家族,包含 50 步 Base 与 4 步 Turbo 两个 6B 参数版本,并发布检查点和基于 Diffusers 的推理代码。

    推荐理由:开源模型同时提供 50 步 Base 与 4 步 Turbo 版本,读者可据此判断快速生成与高保真生成之间的取舍。

  8. inclusionAI Hugging Face models63

    inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image

    inclusionAI 发布并开源 LLaDA-Image 系列统一图像生成与编辑模型,包含 50 步的 Base 与 4 步蒸馏的 Turbo 两个变体,均为 6B 参数,同时提供 BF16 与 FP8 权重。

    推荐理由:6B 参数单权重同时支持文生图与指令编辑,训练配方与推理代码一并开源,便于复现和二次开发。