TileMix:面向 LLM 推理加速的以 tile 为中心的混合精度注意力
TileMix 是一种以 tile 为中心的精度路由内核,将注意力矩阵切分为硬件对齐的 score tile,用紧凑 bitmask 把每个 tile 组分配到 FP16 或 INT8 计算,两条路径共享 online-softmax 状态。
项目更新、模型与开源社区动态
TileMix 是一种以 tile 为中心的精度路由内核,将注意力矩阵切分为硬件对齐的 score tile,用紧凑 bitmask 把每个 tile 组分配到 FP16 或 INT8 计算,两条路径共享 online-softmax 状态。
检索增强问答系统在模型标识、提示词、检索策略等全部固定的情况下,仅因索引从 1 个分片扩展到 7 个分片,就会出现答案漂移。
Apodex 1.1 通过环境扩展与智能体协同扩展两条路径提升复杂任务的持续执行能力,在专业工作、金融、科研、数学、编程和搜索等场景达到领先水平,且所用模型规模明显小于许多前沿系统。其 35B 参数的 Apodex 1.1 Mini 以可本地部署的形式保留了较强的工作能力。
RISE 是一个面向 World Action Models 的系统级自适应想象框架,通过 Latent Evaluator 与 Rollout Gate 逐步做出 Roll/Stop 决策,按预期规划收益动态分配想象预算,减少不必要的 rollout。
研究团队提出 TLive-Omni,一个面向电商直播场景的全模态理解模型,可将图像、视频、音频和文本映射到统一表示空间。该模型引入 Per-vGrid 时间戳 token 组织方式实现音视频时间对齐,并采用三阶段监督训练加 Faithful-RFT 强化微调,在电商直播基准上表现强劲,同时在通用基准上保持良好泛化能力。
WorldMind 是首个面向游戏世界模型的解耦式状态感知 NPC 行为框架,将交互式世界建模拆分为理解、决策、控制与生成四层,并通过闭环重连让 NPC 行为锚定在不断演化的游戏状态上。团队同时发布 BOSS-140K 数据集及可规模化自动采集的智能体,实验显示其能可靠重建紧凑状态并完成基于机制的规划,在约 70% 的成对比较中因 NPC 行为更具战术性与连贯性而优于基线。
Claude Code 发布 v2.1.243,本次更新仅涉及 CHANGELOG.md 与 feed.xml 的维护性改动。
PhysCaP 是一个面向机器人操作的物理信息 Code-as-Policy 智能体,通过引入物理信息探索层,让智能体以交互方式主动获取信息。它包含无需训练的属性提取模块,仅凭机器人本体感知即可估计物体质量与刚度,并采用 Planner 与 Prioritizer 双智能体设计平衡探索成本与信息效率。
Hydra-0 是一个以动作流为条件的通用世界模型,将机器人动作表示为像素运动,从而跨本体、任务、环境和视频生成骨干学习动作后果。其最佳配置相比动作条件基线将机器人运动误差降低 90.4%、物体运动误差降低 60.2%,并在 RoboLab 基准上实现重放与参考成功率之间 r=0.96 的 Pearson 相关性。
研究者提出 PV-SST 同行投票社交平台测试床,用 448 次试验、112 个模型×话题×种子区块检验 LLM 智能体群体行为。相比仅给话题的对照组,按同行点赞排序的往轮帖子信息流提升了最终轮词汇相似度(核心面板 +0.0082 TF-IDF 余弦,p=0.000105;更大变体 +0.0109,p=0.000001),但该对比混合了曝光与排序,无法单独识别排序效应。
SparsePR 是一种免训练稀疏注意力方法,通过 Response-Coupled Partitioning 与 Probe-Fitted Residual Reconstruction,将未探测查询的注意力输出误差较无语义块稀疏注意力降低 61.6–90.5%,执行对密度为 22%。
FlavourBench 在 534 项替换、搭配与约束任务上评测了 27 个前沿大语言模型端点,共产生 14,418 个模型-任务评分单元,Grok 4.6 在该任务集上取得最高点估计 65.1。
ParaTempo 是一个免训练的异步并行推理框架,以分支局部的"时间置信度"(对答案空间收敛程度的度量)驱动全部控制流程:低置信度分支被剪枝、持续收敛的分支提前退役、释放的算力用于派生新分支,置信度加权投票集中后全局停止生成。在数学与科学推理基准上,该方法平均延迟降低 21.8-32.2%,token 总用量减少 18.1-30.3%,同时保持有竞争力的准确率。代码与数据集已公开。
一篇综述提出全谱系人类上下文分类法,将人本智能划分为六个相互关联的层级:作为可观察主体(视觉外观与空间几何)、作为动态行动者(运动动力学与交互建模)、作为情境智能体(世界模拟与具身能动)。文章梳理了该领域的数据家族、计算架构范式与代表性训练和推理优化策略,并系统整理了相关数据集、benchmark 与评测指标,同时讨论了可扩展、可信、物理落地且可部署的开放挑战与方向。
研究者提出 Patch Reparameterization,在保留预训练语义 ViT 原有语义通路的同时,加入重建感知的 patch embedding,使冻结的 ViT 块既能保持多模态理解,又能高保真重建图像。
Daedalus-150M 是一个为 CPU 推理设计的卷积-注意力混合小模型,18 个 block 中仅 6 个保留完整注意力,其余 12 个使用短卷积,内存宽度固定为两个时间步。
EviRank 将多模态图像重排序重构为语义约束满足问题,把纯文本、纯图像或组合查询解析为统一证据包:覆盖实体、属性、关系等六类语义槽位的类型化标准,并标注为必需、禁止或可忽略。该方法在文本到图像、图像到图像和组合图像检索五个基准上取得 SOTA,且无需训练;其蒸馏出的轻量学生模型以显著更低成本保留教师模型 90% 以上能力。
研究者提出两步超参数迁移框架,为大规模 MoE 模型估算最优学习率:先为采用 MLA 和 Muon 优化器的 MoE 适配 μP,使最优学习率在宽度缩放模型间稳定迁移;再沿 token 维度建立预测性缩放律,用小型代理模型线性回归外推到 10 万亿 token 训练规模,R² 达 0.95。
一项受控研究发现,在线策略蒸馏(OPD)传递的是教师的推理行为而非具体答案,训练难度几乎不影响效果,连教师从未解决的问题也有用。迁移效果强烈依赖师生同源关系:同源组合能让学生在跨语言、推理范围甚至其他领域上接近教师,跨源组合则基本只拟合训练分布。这种广泛影响是双刃剑——按领域路由提示词无法限制各教师的影响,多教师组合会在能力间形成依赖混合比例的跷跷板效应。
研究者推出 OmniAssistBench,用于评测 Omni-LLM 作为实时视频助手的交互能力,通过逆向拆解互联网视频构建多轮交互数据,耗时超 1000 专家人时。测试中 Gemini-3-Pro 得 66.4 分(满分 100),开源 Qwen3-Omni-Instruct 得 51.2 分。模型普遍能理解用户输入,但在手势等视觉提示、多轮历史上下文保持和延迟到目标事件再响应上仍频繁出错。
研究团队提出 AgentMercury,一个从高层商业场景合成可执行环境的框架,先构建含实体、服务、工具、状态和跨服务不变量的持久世界,再让任务自然涌现。
针对 LLM/VLM 用户模拟器难以复现真实购物会话的问题,研究者提出 GUI 智能体 RecVerse,通过截图感知页面并生成多轮轨迹。它采用工作记忆、情景记忆与偏好记忆构成的分层记忆机制,并以轨迹级 RL 目标对齐真实用户的动作分布与购物意图。团队同时发布交互式电商 GUI 轨迹数据集 USB,实验显示 RecVerse 在行为保真度与意图一致性上显著优于现有基线。
一篇批判性叙事综述指出,Transformer 模型、检索增强流程与大语言模型(LLM)正在重塑圣训计算科学,数据资源扩充、分词任务成熟、传述人与来源核验问题得到更好形式化,LLM 辅助流程已支持语料规模化扩充、多语言访问与有依据的评估。
论文提出 Graph Engineering(图工程),一种面向下一代 LLM 智能体系统的范式,通过构建显式、动态、演化的图结构来表示任务、智能体与系统状态,从而组织复杂目标、编排异构智能体并支持系统级演化。
研究者提出 CLEAR,一种用轻量隐藏状态门控连续调节安全低秩适配器激活强度的条件式安全适配框架,旨在减少有害输出同时避免改动冻结主干。在 Llama-3-8B-Instruct 上,CLEAR 将 HarmBench ASR 从 32.3% 降至 0.5%,并比全局 SFT 或 LoRA 的 GSM8K 准确率高出最多 7.1 个百分点。
InfinityEdit 是一种轻量级编辑适配器,让流式视频生成器具备无限视频编辑能力:给定前序片段和编辑指令,模型生成延续该流并应用编辑的下一片段。适配器包含历史交叉注意力、时序因果自注意力和编辑交叉注意力三个模块,推理时仅在编辑请求到达的 chunk 激活,后续 chunk 由原模型以重置锚帧生成。实验显示其能在无界编辑序列下忠实延续视频流并保持稳定。
研究者提出 PatternEval 诊断基准,含 2,415 条多模态提示词,覆盖视觉感知与定位、结构化图像理解、多模态知识推理,检测思维链泄漏、响应重复、逻辑矛盾和表演式推理四类失败。
Llama-Mobile 提出一套面向 VLM 的量化框架,采用每参数 2.7-bit 的新格式,可在 Arm CPU 上高效执行,且量化流程由模型自身生成训练数据、无需访问原始训练环境。该框架将 Llama 3.2 11B Vision Instruct 压缩至 3.7 GB(8-bit 激活),在标准视觉问答任务上保持较强性能。
Claude Code 发布 v2.1.241 版本,本次更新以修复 bug 和提升可靠性为主,未引入新功能。
Claude Code 发布 v2.1.240 版本,本次更新以修复 bug 和提升可靠性为主。
FireRedTeam 发布 FireRedAudio,一个基于共享 9B LLM 的通用音频语言模型,采用解耦连续表示,Audio Encoder 负责理解、RedAE 通路负责生成。
推荐理由:原文给出模型架构设计和多基准评测数据,并附完整开源代码,读者可据此评估其音频理解与生成能力。
FlowEvo 是一个免训练框架,让工作流与可执行技能在推理时共同演化,把成功的工作流编译成可调用技能存入持久技能库,并追踪各技能的下游效用、抑制造成负迁移的技能。
TinyCast 是一个无注意力机制的零样本预测器,仅 146,505 个参数即可输出预测分布,其核心思路是用零参数频谱检测器计算上下文的主周期,再按相位折叠后由膨胀卷积编码器和块自回归分位数解码器建模其余部分。
Claude Code v2.1.239 发布,成本估算(/cost、状态栏、--max-budget-usd)现对数据驻留工作区计入 1.1× 美国境内推理溢价。
论文在 37 项任务上对比 10 个 LLM 与 26 个嵌入模型(118M 至 14B 参数),结果显示两种方案总体性能基本持平。
分层机器人基础模型 τ_0-VLA 将高层子任务生成建模为可扩展计算的推理问题,通过世界模型引导的测试时计算,在每步推理中借助执行记忆生成子任务,必要时搜索备选方案后再输出。该模型基于 40,115 小时异构真实世界数据和多模态协同训练,在域内与分布偏移场景下增加测试时计算均显著提升下一子任务预测准确率,并转化为长程机器人操作任务更高的闭环成功率。
QuoteBench 用 56 个一次性任务、14 个事故衍生家族,在生成契约与执行传输之间加入一个故意未转义的解析器,测量命令生成错误与生成后故障的边界。八个同窗口配置中,同一回复经该解析器重放后成功率下降 55.4 至 73.2 个百分点,披露边界可为六个配置挽回 30.4 至 60.7 个百分点。
研究者提出分层自我改进(HSI)框架,让冻结的 LLM 在任务 harness、改写 harness 的 evolver 和改写 evolver 策略的 meta-evolver 三个层级上运作,harness 可随迭代热切换并依据环境反馈重写。
研究人员提出 GOAG,一种学习特定夹爪接触面分布隐表示的深度生成模型,无需物体专属训练数据即可采样有效抓取配置,仅在推理时引入物体特征。在 MultiDex 数据集上,该方法平均成功率达 86.93%,生成大量抓取时速度显著更快,性能与专门针对该数据集训练的领先方法相当。
CoToGrasp 是一种严格以特定接触拓扑为条件生成多样稳定抓取的生成式框架,采用与物体无关的训练方式,通过基于特征的规范工作空间将局部物体特征投影到统一的以夹爪为中心的域中,实现对未见物体的零样本泛化。在 DexGraspNet 数据集上,CoToGrasp 取得 SOTA 性能,超越现有分类法引导的规划器,并在实体机器人平台上验证了所合成接触拓扑的物理可行性与运动学可行性。