Window Lab,用 Krea Agent 创建的应用。 只需上传你的视频,调整运动控制,即可获得你想要的效果。 在下方试试 👇
全部AI 动态
全部动态
今日 325 条
Krea@krea_aiAI 评分2626
Hugging Face Daily PapersAI 评分3838 Align Then Reason:面向配音的多模态唇形同步评判模型
研究者提出多模态唇形同步评判模型 Align Then Reason(ATR),先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于对齐结果推理内容与时间是否匹配。
Hugging Face Daily PapersAI 评分3535 PEARL:基于推理与反思的个性化图像生成,提出首个用户历史个性化图像生成基准
研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。
Hugging Face Daily PapersAI 评分3333 Architect-Ant:可编辑的自动户型图家具布置框架
Architect-Ant 提出一种从真实户型图学习专业家具布置知识的框架,无需依赖昂贵的迭代智能体推理即可生成满足约束的布局。其配套数据集 AntPlan 包含 505 张真实专业建筑户型图,覆盖 92 类物体和十类住宅房间。
OpenRouter Announcements精选AI 评分6666 OpenRouter 教程:如何测试 AI Agent 的工具调用准确性
OpenRouter 发布教程,讲解如何测试 Agent 的工具调用准确性,核心是分开测试工具选择与参数正确性这两类失败。
推荐理由:原文区分了工具选择错误与参数错误两类失败模式,并给出 LLM judge、JSON Schema 校验和轨迹比较三种可落地的测试方法。
Hugging Face Daily PapersAI 评分5858 arXiv 论文揭示非侵入式脑到文本解码中的时间捷径并提出 SimpleB2T
研究发现非侵入式脑信号解码单词的主要性能提升可在无脑数据时复现,固定长度窗口重叠隐式泄露词间时长信息,合成无脑信号达 22.0% balanced accuracy,接近真实脑记录的 22.3%。作者改为独立处理各窗口以消除该捷径,提出的 SimpleB2T 在感知语音基准上达到 36.6% 词错率(每词五次观测)。
Google Developers BlogAI 评分4242 在 TPU 上加速视频扩散模型的时空注意力
Google 分享了在 TPU 上把视频扩散模型稀疏注意力从理论稀疏转化为端到端加速的案例研究。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升到 1440p 序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
Hugging Face Daily PapersAI 评分4343 自回归 Transformer 如何从局部观测外推混沌系统的全局动力学
小型自回归 Transformer 仅用受限参数区间的轨迹训练,就能在训练分布之外的闭环评估中复现倍周期分岔、混沌动力学和吸引子结构。在 logistic 映射上,模型复现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。研究还通过因果干预揭示了控制参数信息经注意力机制影响状态预测与闭环动力学的路径。
OpenRouter Announcements精选AI 评分7070 OpenRouter 教程:Prompt 或模型变更后如何对 AI Agent 做回归测试
OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。
推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。
Hugging Face Daily PapersAI 评分4343 让 AI 审稿人更可信:RobustReview 基准与 SciCore 审稿模型
研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。
Hugging Face Daily PapersAI 评分4545 BeyondSCe:面向事件指代抓取的主动视角选择零样本机器人系统
零样本机器人抓取系统 BeyondSCe 可依据目标在过往事件中扮演的角色而非名称或外观来定位并抓取,目标被遮挡时结合事件先验与当前场景几何主动选择视角。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%;在四个重度遮挡场景中成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。
Hugging Face Daily PapersAI 评分3737 跨会议持久说话人归属评估:SI-cpWER 基准与 ThyVoice 参考系统
研究提出 Speaker Identified cpWER(SI-cpWER)指标,在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪两种形式)及 CHiME-6。
Hugging Face Daily PapersAI 评分3535 邻近监督更优:Neighborhood OPSD 自蒸馏方法提升数学推理模型性能
Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。
Hugging Face Daily PapersAI 评分3333 PhysVista:通过感知-推理-评估闭环基准测试VLM的物理智能
PhysVista提出一个闭环认知框架基准,联合评估视觉语言模型的物理状态感知、物理动态推理与物理合理性判断,并区分事件级与尺度级推理。该基准同时纳入真实世界与AI生成视频,覆盖多样领域与新兴生成场景。对多种VLM的实验显示,模型在物理推理与合理性评估上存在显著局限,视觉识别与真实物理理解之间仍有明显差距。该研究被NeurIPS 2026主会议接收。
Hugging Face Daily PapersAI 评分3737 DexPolicy:面向轨迹引导灵巧操作的调度式探索
DexPolicy 将强化学习的探索尺度设为训练步数的显式函数,从宽到窄退火,在 ViViDex 等轨迹引导的灵巧操作任务中提升确定性 Target 成功率。在五个 YCB 物体、三个随机种子上,FPO 的平均成功率从 49.4% 升至 68.1%,GRPO 从 14.1% 升至 45.4%,PPO 从 32.0% 升至 35.7%。
Hugging Face Daily PapersAI 评分3939 LEAP:面向长音视频感知的学习式分块证据检索框架
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
Hugging Face Daily PapersAI 评分4040 PixelDense:将稠密预测作为像素扩散的表征对齐
PixelDense 提出用稠密预测模型替代纯语义编码器作为像素扩散的表征对齐目标,将 DINOv2 与 SAM2 归入语义投影流、Depth Anything v2 与 Metric3D v2 归入几何投影流,并加入权重空间正交惩罚使两流处于不相交子空间。
Hugging Face Daily PapersAI 评分3535 ATLAS:对齐潜在结构传输,提升世界模型规划可靠性
研究者提出 ATLAS 训练目标,通过将编码器表示中的归一化成对结构迁移到规划潜在空间,并用 Wasserstein 嵌入匹配(WEMReg)校准其边缘分布,从而在变换中保留规划相关的关系几何。
Hugging Face Daily PapersAI 评分4040 Soft Spatial Reasoning:用软思考提升 LVLM 空间推理
针对 LVLM 用 CoT 做空间推理时每步必须锁定单个 token、易造成过早离散化并传播错误的问题,研究者提出 Soft Spatial Reasoning 后训练框架,通过混合 token 嵌入形成连续软状态,让多个候选延续共同影响下一步推理。
Hugging Face Daily PapersAI 评分4545 Multimodal Flow:在嵌入空间统一语言与视觉的流建模
Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunks,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场。
Hugging Face BlogAI 评分5252 Hugging Face 发布 Open TTS Leaderboard:可扩展的多语言 TTS 与语音克隆评估
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
Hugging Face Daily PapersAI 评分4646 DAGent:面向深度研究智能体的 Evaluate-then-Grow 规划框架
DAGent 是一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划,由 Orchestrator 依据已完成节点的置信度与不确定性信号逐批扩展任务图。
Hugging Face Daily PapersAI 评分3535 EvolvingNav:面向演化世界持续导航的预测式 4D 信念
研究者提出 EvolvingNav,通过时间索引的 3D 物体历史构建持久-迁移结构化信念,并用事件驱动滤波器在目标未被观测移动时预测其状态、结合 RGB-D 证据修正位置假设,配合冻结的零样本视觉语言控制器完成动作选择与重规划。
Hugging Face Daily PapersAI 评分3232 SpatialCORE:让大型视觉语言模型基于置信度进行空间推理
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
Hugging Face Daily PapersAI 评分4242 用在线蒸馏缓解长度扩展税:Length Self-Distillation 方法
针对 RL 后训练中已解出问题回复变得冗长的"长度扩展税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。
Hugging Face Daily PapersAI 评分3434 MemLife:面向长期第一视角视频记忆的整理与推理系统
MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。
Hugging Face Daily PapersAI 评分4545 GraphForge:用图锚定工作区合成训练工作型智能体
GraphForge 是一个基于证据图的工作型智能体训练框架,从职业种子出发为每个种子组装真实文件工作区并构建证据图,任务描述与评分标准均由该图派生,使每条标准都锚定到验证所需的文件。
Hugging Face Daily PapersAI 评分4646 合成预预训练在规模扩展下依然有效,但并非语法先验
一项覆盖 500M 至 7B 参数、PT 预算最高 100B token 的研究显示,合成数据预预训练(PPT)的 token 效率增益在规模扩展后依然存在,3B 规模下可节省至少 21B PT token。但研究未发现一致证据表明这些增益来自语法先验,下游表现与语法可接受性在各模型规模上并不一致。增益实际来自提升长程检索能力的 PPT 任务,且对 PT 数据混合方式稳健,仅在缺少网页文本时减弱。
Hugging Face Daily PapersAI 评分6060 研究提出 WildAI 缩放律:衡量 AI 生成网页文本对预训练的价值
该论文研究预训练数据中“野生”AI 生成网页文本的影响,用 Pangram 标注发现 FineWeb 过滤后 2026 年 6 月网页 token 中 27.5% 为 AI 生成,8 月升至 31.1%。
Hugging Face Daily PapersAI 评分4141 通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型
研究提出位置选择性自蒸馏方法,利用自然语言反馈训练 LLM 评判模型。该方法基于教师与学生模型间的逐位置熵偏移进行位置掩码,保留熵偏移分布的低尾部分,从而提升分布外泛化能力。实验显示,自蒸馏评判模型在主观任务子类别上比 GRPO 等结果监督强化学习训练的评判模型高出 2-9 个百分点,在客观任务上保持竞争力。
OpenRouter Announcements精选AI 评分6868 OpenRouter 教程:如何从生产流量构建 Golden 评测数据集
OpenRouter 发布教程,讲解如何从生产流量构建 golden eval 数据集,用于在每次部署前检测提示词或模型变更引起的回归。内容涵盖五步流程:抽样生产流量、去重聚类、添加经审核的预期输出、首轮评估修正评分标准、纳入 Git 与 CI,建议探索性问题约 10 条、完整回归集 100 到 1,000 条,并以生产数据为基础、合成数据补足覆盖缺口。
推荐理由:原文给出从生产流量构建评测集的五步流程和规模建议,可迁移到自己的模型回归测试工作流。
Apple Machine Learning ResearchAI 评分5353 Apple 发布 SCLATE:持续学习智能体训练与评测的执行基底
Apple 发布 SCLATE,一个持续学习智能体训练与评测的执行基底,基准和未修改的智能体通过适配器把事件加入同一开放事件调度器,混合模拟时钟可把一个月长的场景压缩到数小时。
Hugging Face Daily PapersAI 评分3636 DARA:面向多奖励强化学习的密度感知奖励聚合方法
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。
Apple Machine Learning ResearchAI 评分4141 LLM 条件控制中的有效性-流畅性权衡:一项系统性研究
Apple 研究团队系统考察了 LLM 条件控制方法在概念注入与移除场景下的表现,发现高效激活引导方法往往以流畅性大幅下降为代价。研究还发现激活引导在指令微调模型上的效果远不如基座模型,而提示词与监督微调适合概念注入却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。
Hugging Face Daily PapersAI 评分3838 EgoTools:面向真实世界第一视角视频的工具中心推理
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
Hugging Face Daily PapersAI 评分5555 arXiv 论文:多智能体系统潜空间通信的安全风险与修复
研究显示,多智能体系统的潜空间通信即使良性训练链接也会提高有害顺从度,而智能体本身的安全对齐未被改动。攻击者可通过在有害查询-响应对上优化链接、投毒训练数据或强化学习攻击放大该效应,在三种通信拓扑和四个安全基准上将平均有害顺从分从 27.9 提至 76.9;把奖励调整为更安全行为可修复被攻陷的链接,无需更新智能体。
Hugging Face Daily PapersAI 评分3737 AutoDataBench:面向加速自动研究的数据中心测试平台
AutoDataBench 是一个隔离数据因素、系统评估 LLM「数据智能」的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,在固定非数据因素下考察前沿 LLM 通过迭代实验改进训练数据的能力。研究还对比训练前预测与实际结果,检验 LLM 是否具备数据效应推理能力,并发现复用 AutoDataBench 轨迹进行 mid-training 可提升下游编码性能。
Hugging Face Daily PapersAI 评分4141 DyRAD:面向动态驾驶场景的雷达新视角合成
DyRAD 用静态背景反射体与运动跟踪的动态点反射体建模动态驾驶场景,渲染完整的距离-方位-多普勒(RAD)张量,并通过源自雷达信号处理链的固定解析点扩散函数(PSF)渲染反射体,避免传感器扩散被写入场景表示。
Hugging Face Daily PapersAI 评分4040 StreamMAE:让自监督学习在连续视频流上奏效
研究团队构建了 95 小时城市步行游览视频数据集 WT++,用于严格按时间顺序、滑动窗口批次的流式自监督预训练。结果显示对比学习和蒸馏方法在此设定下表现不佳,MAE 较稳健但仍不及标准 i.i.d. 预训练,主要瓶颈是批内帧高度相似。
Replit ⠕@ReplitAI 评分4747