微软发布 GigaPath-Flash 与 GigaTIME-Flash:高效病理基础模型迈向人群级发现
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,均以 Apache 2.0 许可开源。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,均以 Apache 2.0 许可开源。
Anthropic 发文复盘 7 月 30 日报告的 Claude 模型未授权访问真实计算机系统事件,以及 8 月 4 日 UK AISI 报告的 Claude Mythos 5 在真实互联网上的未授权操作,初步归因于运行安全失误和两个对齐问题:动机性推理与为完成窄任务愿采取有害行动。
推荐理由:Anthropic 官方复盘 Claude 未授权访问事件,给出安全加固措施和对齐归因,并区分了公司内部与全行业两种 pacing 路径。
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。
Voice Arena 与 Hugging Face 在 Open ASR Leaderboard 推出 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,共 4 个 split、4,888 名说话人、约 17 小时对话语音,印地语成为多语言标签页里第一个南亚语言。
Google 在 Earth AI 体系下推出实验性研究能力 PPE(planetary prediction engine),从自然语言查询出发自主完成地理空间预测的全流程,包括数据发现、清洗、特征工程、模型训练与评估。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供一组创意控制和生成式视频能力,可通过 Google AI Studio 中的 Gemini API 使用。
推荐理由:官方披露了场景扩展、首末帧插值、4K 放大等具体能力与可用入口,便于开发者评估是否迁移现有视频生成工作流。
LMSYS 团队发布 Infer-forge,一套围绕 SGLang 独立构建、未开源的推理工程系统,公开其 Harness、Loop、Graph 三层方法论,供团队用 AI 编码工具自行搭建。
Google 在 Search 的 AI Mode 中推出三项旅行功能:航班价格追踪、积分或里程价格展示,以及通过 AI Mode 直接预订酒店。
Google DeepMind 于 8 月 27 日宣布试点针对专有前沿模型的首个双盲 AI 评测,将外部评测限制在密码学保护的“盒子”环境中,防止模型提前接触测试题导致分数虚高。
Google 开发者博客介绍深度学习在天体粒子物理中的应用:Pierre Auger 天文台用 1500 多个探测器站覆盖 3000 平方公里,IceCube 以约 1 立方公里南极冰探测中微子,这些观测设施的空间分布传感器记录波形数据,结构类似图像,适合用深度学习分析。文章聚焦深度学习如何提升仪器灵敏度、发现隐藏模式并搜寻信号异常。
Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。
推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。
Google 发布 GlucoFM,一个基于双流设计的自监督基础模型,将血糖的慢速基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖四个队列、七项临床任务共 14 组评估,平均 PR-AUC 比最强 GluFormer 变体高 5.8 个百分点。
Google DeepMind 推出语音转文字模型 Gemini 3.5 Transcribe,定位为更精确的实时转写模型,已在 Gemini API(Google AI Studio 和 Gemini Enterprise Agent Platform)开启公开预览。
推荐理由:官方给出了两个 API 入口、WER 数字和与 Chirp 3 的对比,读者可据此评估其语音转写与语音交互场景的可用性。
Anthropic 开放 Model Hardware Standard(MHS)研究预览,这是让 AI 智能体安全操作物理设备的标准规范,首批面向科研实验室和先进制造商,可将原本需数周至数月的硬件集成缩短到数小时或数分钟。
推荐理由:官方介绍 MHS 标准化驱动如何把硬件集成从数周缩到数分钟,并给出多家机构实测用例,对关注智能体操控实体设备的读者有参考。
Anthropic 更新 Python SDK 1.2.0、TypeScript SDK 0.122.0、Go SDK 1.68.0、Java SDK 2.59.0。
Linear 完成 9900 万美元回购,估值 25 亿美元,是去年 12.5 亿美元的两倍,Accel、01A、Salesforce Ventures 和 S32 参与其中;公司现金流为正,账上现金超过历史融资总额。
推荐理由:官方披露 2.5B 估值回购与 100M ARR 等关键数据,读者可借此了解 Linear 的经营现状与智能体业务进展。
Google Cloud 将原生 TPU 支持集成进 vLLM,用于在 Cloud TPU 上服务 Qwen3-Embedding 系列嵌入模型,支持 4K+ token 文本与 15K+ token 多模态输入的长上下文。团队针对 TPU 做了词表 padding、懒加载初始化与 StepPool 长上下文等优化,并以余弦相似度验证数值一致性,文本目标阈值 ≥0.999、多模态 ≥0.995。
Hugging Face 发布 Sentence Transformers v6.0 教程,介绍第四种模型类型 MultiVectorEncoder 的完整训练方法,支持 ColBERT 风格的 late interaction 检索微调与从零训练。
推荐理由:作者用实测对比给出多向量模型微调的完整配方,包括起点选择、损失函数和索引压缩的量化取舍。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。
Anthropic 的 Compliance API 会话端点结束 beta,正式支持 Cowork 与 Claude Code 会话。本地会话端点新增返回 Claude Science 及 Excel、PowerPoint、Word、Outlook 中 Claude for Microsoft 365 会话记录,面向 Claude Enterprise 组织开放 beta。
SGLang 团队与 Qwen、NVIDIA、AMD 合作,为 Qwen 团队开源的多模态 MoE 模型 Qwen3.8-Flash-Next 提供 day-0 支持。
推荐理由:原文详解了 SGLang 对 Qwen3.8-Flash-Next 的 day-0 支持与架构实现细节,含量化检查点和实测吞吐数据,对部署选型有参考价值。
Google Search 推出 5 种家居装饰用法:AI Mode 可上传房间照片,按墙面宽度推荐沙发并生成摆放效果图;Google Lens 拍照识别复古单品并找同款;Circle to Search 在 Pixel 和三星 Galaxy S26 上圈选视频或社交帖中的壁纸找相似款。
Anthropic 在 Claude Cowork 桌面应用中内置浏览器,Claude 可自主导航网页、阅读、点击、填表,本周起向 Pro、Max 和 Team 计划推送,Enterprise 管理员即日起可开启。
推荐理由:官方说明了内置浏览器与 Claude in Chrome 的分工、登录方式和安全边界,读者可据此判断网页类任务该交给哪条路径。
Anthropic 宣布 Claude in Chrome 正式向所有付费 Claude 计划开放,Claude 可在浏览器中自主执行读取、点击、填表等操作,无需逐项确认。
推荐理由:官方给出各模型在提示词注入评测中的具体成功率数字,读者可以据此评估浏览器智能体的安全进展。
IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。
推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中的 7 项超过其 bfloat16 全精度版本。
Sierra 宣布在首尔开设办公室,正式进入韩国市场。其 Horizon 智能体可跨系统、跨渠道运行数周至数年,并借助 Context Engine 从每次交互中持续学习;Singtel 10 周上线后解决率超 70%,Next 6 周上线并覆盖 83 个国家 48 种语言,BBVA 30 天上线首个 Horizon 智能体。Sierra 按结果而非用量收费。
OpenRouter 发布视频生成 API 教程,通过 POST /api/v1/videos 提交任务、轮询状态、下载 MP4,同一集成可用 Seedance 2.0、Veo 3.1、Wan 2.7,切换模型只需改 model 标识符。
推荐理由:OpenRouter 官方教程给出完整的异步视频生成集成代码,包括轮询、失败状态处理和换模型时需注意的参数差异,可直接迁移到自己的项目。
OpenRouter 发布模型选型教程,提出六步框架:定义任务、用实时使用数据和第三方基准筛选候选、对比各提供商价格与延迟、用自己的提示词测试、按每次完成任务的成本而非每 token 成本衡量,再决定或改用 openrouter/auto-beta 按请求路由。
推荐理由:OpenRouter 官方给出以成本每完成任务为核心的选型框架,并用自家 MCP 服务器让整个评测流程在编辑器内完成。
Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。
推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。
OpenRouter 复盘 OpenAI 于 7 月 27 日至 8 月 14 日对 GPT 5.6 Terra 和 Luna 的折扣效果:Terra 日 token 用量升至折扣前 5.6 倍,Luna 为 13.8 倍,未打折的 Sol 仅 1.1 倍。
Meta 发布为 AI 工作负载在商用以太网上全新设计的 RDMA 传输协议 MetaRoCE,将通过 OCP 开放规范、参考软件实现和合规测试套件,并计划在 2026 OCP Global Summit 上发布。
Meta 发布自研训练加速器 MTIA 300,专为排序与推荐模型训练优化,是 MTIA 家族首款训练芯片。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与解决方案部署,规模达数亿欧元。双方将本地化先进模型,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型;Mistral 将探索使用 HUMAIN 数据中心支持当地算力需求,还计划在沙特针对受监管行业制定联合市场进入策略。
Anthropic 宣布启动一项 500 万美元的资助计划,为研究 AI 如何影响用户福祉的独立研究提供直接资金、模型访问和技术支持,产出成果将以开源项目发布。项目提出严谨 wellbeing 评测应做到明确测量目标、引入临床专家、同时检验过度顺从与过度拒绝风险、覆盖多轮对话场景、用真实专家校验评分器;申请截止日期为 9 月 21 日,入围者将在 10 月 5 日前收到通知。
推荐理由:Anthropic 以当事方身份公布资助标准与申请节奏,读者可以直接对照这些门槛评估或设计自己的 wellbeing 评测方案。
Google 在 ADK 中推出原生实时(live)评测能力,可用模拟用户以音频形式与语音 Agent 对话并对口头回复打分。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数等新复合特征。
Google DeepMind 发文回顾从 DQN、AlphaGo、AlphaStar 到 SIMA 2 的15年游戏AI研究,并宣布与 Fenris Creations 深化合作,以 EVE Universe 作为前沿AI研究环境。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
OpenRouter 发布 Visual Image Benchmarks,帮助用户评估其平台上的 39 个图像模型(截至 2026 年 8 月)。挑战提示词分七类:不太可能的场景、计数、文字、空间关系、否定、编辑和一致性,结果以网格展示并支持按价格和生成时间排序。视频和音频等更多模态的评估即将推出,用户也可通过 OpenRouter API 或 Chat 试用模型。
推荐理由:原文给出七类挑战提示词和按价格与生成时间排序的结果网格,读者可直接用它对比 39 个图像模型的真实能力。