LLM 能否自行设计 Agent Harness?ByteDance Seed 的 HarnessDev 称 64 次改动中仅 34 次可泛化
ByteDance Seed 联合新加坡科技设计大学、佐治亚理工等提出 HarnessDev,把评测对象从模型给出的答案换成模型自己编写的可运行 agent harness。
网站与博客 · 历史来源 · 当前未持续收录
ByteDance Seed 联合新加坡科技设计大学、佐治亚理工等提出 HarnessDev,把评测对象从模型给出的答案换成模型自己编写的可运行 agent harness。
Anthropic 为 Claude Code 发布插件评测工作流,用真实提示词运行插件,并与不加载插件的运行结果对比,两者差值 Δ 即插件的贡献。
Cohere 发布开放权重翻译模型 North Small Translate,采用 218B 总参数、25B 激活参数的稀疏 MoE 架构,覆盖 50 种语言,在 Cohere 自测的 WMT26 上全语言均分 83.6。
Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 两款模型,它们不是单一基座模型,而是通过一个 API 在多个模型池之间路由任务的编排器,以兼容 OpenAI 的托管 API 提供,没有开放权重,且不在 EU/EEA 提供服务。
Google Research 联合东京大学、RIKEN AIP 和东北大学发布 ToolGrad,一种先构建已验证工具调用链、再反向生成用户查询的数据生成框架,通过率达 99.8%。
Redis 在 Redis Cloud 上推出全托管的语义缓存服务 LangCache,目前处于公开预览,通过 REST API 与 Python、JavaScript SDK 调用,官方称最高可降低 90% 的 LLM API 成本、缓存命中响应最高快 15 倍。
NVIDIA 详解 BioNeMo Inference Runtime(BioIR),一个在 NVIDIA GPU 上加速结构预测模型的 Python 库,保持标准 PyTorch 工作流。
OpenAI 发布 Agents API 公测,把驱动 Codex 的 harness 与基础设施开放给开发者,智能体算力可跑在 OpenAI 托管沙箱、自有基础设施或合作方沙箱中。
DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,具备 1M token 上下文窗口,全局 KV 缓存占用约 890 字节每 token,约为 DeepSeek-V4-Flash 的 1/4。
推荐理由:DeepSeek-V4.1-Flash 把全局 KV 缓存压到 890 字节每 token,长上下文推理的部署成本变化构成主要看点。
LandingAI 发布 Agentic Document Extraction(ADE)Gen2,基于新的 DPT-3 模型族将文档按树结构解析,并改为按页加输出字符计费,现已正式可用。
Google 开源了 Mantis,一套与技术栈无关的安全审查技能工具包,让编码 Agent 完成漏洞发现、去误报、沙箱复现、编写最小补丁和再攻击验证的完整流程。
NVIDIA 发布 CUDA Rust,推动 Rust 成为编写 GPU kernel 的一等语言,并开源 NVlabs 的两个项目 cuda-oxide(SIMT 模型)与 cutile-rs(Tile 模型),二者都能原生编译 Rust kernel,并用 Rust 所有权规则在编译期拒绝别名错误。
Google DeepMind 发布 AlphaGenome Atlas,对人类基因组约 90 亿个单核苷酸变异预计算分子效应预测,形成约 1PB 数据集,并推出把变异按预测影响排序的 AVI 分数。
Reducto 发布文档解析模型 r-1,用单次全页解析取代多阶段 agentic OCR,官方称错误率较自家旧版 agentic 流程降低 20%,速度更快且成本最高降低 6 倍。
OpenBMB 发布 MiniCPM5-2B,是 MiniCPM5 系列第二个 checkpoint,参数量 2,516,756,480(其中嵌入层外 1,981。
Axis Robotics 联合 UC Berkeley、Georgia Tech、NTU 等团队发布 AXIS,一套把遥操作采集搬进浏览器、由后端 GPU 负责渲染与训练的机器人操作数据引擎。
IFM 发布 K2 Horizon 系列六款 Apache 2.0 模型,参数从 0.9B 到 375B,并同步开源预训练语料、中间 checkpoint、训练代码、配置和细粒度日志。
推荐理由:六款模型共享架构、词表和部署工具,团队可在 3.7B 上原型验证后不换推理栈扩到 375B-A23B。
H Company 发布 NeoMME 系列 260M 与 800M 双向编码器,去掉单独预训练的视觉塔和从不生成 token 的因果解码器,由同一个 Transformer 处理多语言文本 token 与 32×32 原始 RGB 图像 patch,并从随机初始化开始训练。
Meta FAIR 联合牛津大学和伦敦大学学院提出 AI Research Preference Models(RPMs),在实验执行前对未运行的候选方案排序并只执行胜出者,不做绝对分数预测。
UC Berkeley 研究团队发布开源平台 CUA-Lite,把计算机使用智能体的智能体、环境、轨迹与训练评测框架统一到一套动作空间和数据 schema,覆盖桌面、浏览器和移动端。
Perplexity 工程团队发布《Fast Embeddings on GPUs》,详解支撑 pplx-embed 及搜索、Computer 与 API 平台排序模型的 GPU 服务栈。
GitHub 发布 Project HydraFusion,一个在 GitHub Copilot CLI 内提供的研究预览,按每个请求构建执行计划,而不是把提示词路由到单一模型。
Nous Research 为 Hermes Desktop 加入一键本地模型配置流程,可读取硬件、挑选适配模型、下载权重并自动配置推理运行时。该流程首次启动时自动出现,之后可在 Settings → Providers → Local Models 进入,本地模型无需账号。
Adaption Labs 发布 Invent a Dataset,可从行为描述直接生成结构化训练数据集,无需种子语料、预定义 schema 或标注指南,现已在 Adaption 应用、Python SDK 和 REST API 上线,生成结果可下载为 JSONL、JSON、CSV 或 Parquet。
Google 在 Gemini Flash 模型上线智能体视频理解,由模型自行决定观看哪些片段、以什么帧率和模态加载,官方称视频 token 最多减少 88%、成本最多降低 66%、准确率最高提升 7%。
NVIDIA 发布开源虚拟推理路由器 Personal AI Router(PAIR),本周以公测版 v0.1.1 上线,提供 Windows、macOS 与 Linux 签名安装包,源码在 GitHub 以 Apache 2.0 开放。
Google DeepMind 与 Google Research 发布 WeatherNext 3,直接以实时地球静止卫星拼图为模型输入,每小时重新初始化,输出 0.05°(约 5 km)全球预报,并直接用原始气象站观测而非仅再分析网格进行训练。
OpenAI 发布 GPT-6 Astra,定位为计算机操作模型而非聊天模型,上下文窗口 1,050,000 token、最大输出 128,000 token,不开放权重,目前仅对 Trusted Access 和 Daybreak 项目的组织开放。
推荐理由:原文给出 Astra 的上下文处理改动与网络安全门槛,读者可据此判断它在智能体工作流中的可用边界。
Anthropic 本周发布 Apache 2.0 开源的 anthropics/commerce-agents 蓝图,包含购物智能体和商家智能体,覆盖零售、旅游。
Meta Superintelligence Labs 发布 Muse Spark 1.3 智能体编码模型,今日已在 Muse Code 和 Meta Model API 上线。
Perplexity 开源了 Perplexity Computer 中 Hybrid Compute 背后的本地推理引擎 Lily,这是一个 Rust 层加载 checkpoint 并驱动生成循环。
Qwen 开发者团队开源了本地优先搜索层 zg(zvec-grep),把语义搜索、BM25 和 ripgrep 统一到一个接口,代码以 Apache 2.0 许可发布在 zvec-ai GitHub 组织,可从 npm 安装 @zvec/zvec-grep,需要 Node.js 22 或更高版本,默认模型不需要 GPU。
NVIDIA 以 Apache 2.0 发布 Switchyard,一个用 Rust 编写的 LLM 流量代理与库,可在 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages 三种入站格式之间翻译,并把请求按路由算法转发到 vLLM、NVIDIA NIM 或 Ollama 等后端。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,两者共用同一底座,差别在安全边界和开放范围。
Anthropic 发布 Enterprise Frontier Safeguards(EFS),将监控数据存放在客户自控的云基础设施中,检测仍由 Anthropic 负责,客户掌握数据保管权、密钥与人工审查。
Meta Superintelligence Labs 发布 Muse Voice Transcribe,用一个自回归模型在一次推理中同时完成流式 ASR、20+ 说话人分离与端点检测,无需额外后处理。
Perplexity 面向 Mac 推出 Hybrid Compute,把同一个 Computer 任务在云端前沿模型与本地模型之间拆分,由设备端隐私门控决定哪些内容可以离开本机。
Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,两者是同一底层模型、仅安全防护层不同。
普林斯顿大学、蚂蚁集团与斯坦福大学的研究者提出 AQuA,一个由语言模型驱动的两部分智能体研究框架,分别用于加密货币符号化 alpha 因子发现和美国股票时序模型开发,两部分不共享智能体、记忆与候选空间。
Gradium AI 发布新的文本转语音模型并设为 API 与 Studio 默认模型,在 500 句五语言硬案例集上取得 81.0% 人工评分通过率,超过 Cartesia Sonic 3.6 的 75.1% 和 ElevenLabs v3 Conversational 的 65.4%。