Simon Willison 发布 llm-typesafe 0.1a0 插件,为 LLM 接入 TypeSafe AI 的 Jev 模型
Simon Willison 发布 llm-typesafe 0.1a0 插件,让 LLM 工具支持 TypeSafe AI 新推出的 Jev 模型。
Simon Willison 发布 llm-typesafe 0.1a0 插件,让 LLM 工具支持 TypeSafe AI 新推出的 Jev 模型。
OpenAI 于 2026 年 7 月发布全双工语音模型 GPT-Live-1,可同时听和说,无需轮次检测器。
超聚变在 2026 国际探索者大会上提出"智企"概念,并发布 FusionOne AI 企业级 Token Factory 解决方案、FusionServer"无极"架构及首发产品 FusionServer V9 系列。
英国 AI 安全研究所(AISI)宣布使用 EvalEval 的 Evaluation Cards 开放共享评测结果,以支持更可复现、可验证的评测科学。
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
OpenRouter 用 Banking77 测试集的 3,080 条客服语句对比 Jev 1.13 和 Claude Opus 5 的意图分类能力。
推荐理由:原文给出了同一测试集下的准确率、延迟和成本对比,以及置信度级联方案,可用于判断小判断模型能否替代前沿模型。
Google AI 订阅用户现可直接获得 Colab 高级权益,包括优先使用更快的加速器和更强算力的机器。Google AI Ultra 订阅者还可解锁不间断后台执行和 Premium GPU 访问,长时间训练无需保持浏览器标签页开启。该权益将在未来几周内向 Colab 支持国家的 Google AI 订阅用户逐步推送,已有 Colab 订阅不受影响。
OpenRouter 推出 Batch API,提交批量请求后供应商可在 24 小时窗口内完成,per-token 价格通常为常规价的 50% 或更低,已支持 70 多个模型。
推荐理由:官方给出了实测的批次完成时长分布和提交时段差异,便于读者判断批量推理能否接入现有工作流。
Hugging Face 宣布 transformers 支持通过 from_pretrained 加载 GGUF 量化模型,复用 ggml 的 Metal 内核,初始聚焦 Apple Silicon 上的 Qwen3.5 架构。
推荐理由:原文给出加载方式、性能对比数据和方法论,读者可据此判断在 Mac 上用 transformers 跑 GGUF 的可行路径。
TypeSafe AI 上周发布 Jev,称其为 System One 或决策模型:接受文本输入,输出对应类别、是非判断和评分的浮点数及置信分数。其首个模型按输入 token 计费,每百万 token $0.042,输出免费,比 GPT-5 Nano($0.05/百万)更便宜;问题并行评估,但对数字、日期和对抗性内容表现不佳。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批类别为电池储能系统(BESS)和冷却分配单元(CDU)。
ByteByteGo 撰文讲解如何在普通硬件上运行大模型推理。文章解释内存容量、带宽和 prefill 与 decoding 两阶段的瓶颈,并逐一介绍量化(8B 模型 16-bit 权重约 16 GB。
Linear 因 AI 智能体加速写代码使 CI 成为瓶颈,系统性改造后把 PR 等待时间从 6 分多钟降到 5 分多钟,单个测试的 runner 时间约减半。
推荐理由:原文给出完整的 CI 优化路径和各步骤量化收益,其他团队可对照迁移到自己的流水线。
感谢 @sgl_project 的 day-0 支持!🙌 SGLang-Diffusion 现已支持 Qwen-Image-2.1:文生图、多图编辑,以及透明 RGBA 输出。快来试试!🎨
Day-0 support for @Alibaba_Qwen’s Qwen-Image 2.1 is here in SGLang-Diffusion! 🖥️ Native precision on a single RTX 4090 24GB with CPU offload - 1024×1024 generation in 18.7s and image editing in 21.7s with 22.7 GiB peak GPU memory during requests. - On an RTX PRO 6000 96GB: 8.0s generation and 9.6s editing. 🎨 Text-to-image, multi-image editing, and transparent RGBA output—all with one checkpoint. ⚡ Native inference with TP/SP, LoRA, and OpenAI-compatible APIs. 40 denoising steps, one image per request, warmed HTTP latency including PNG output. No quantization. Cookbook and GPU-specific commands below 👇
Descript 借助 OpenRouter 和 Anthropic 的 Slack 集成 Claude Tag,把新模型评测从几小时工作加一周等待压缩到一两小时内完成,无需再占用工程师排期。
Hugging Face 发布 tokenizers v1 候选版本,单线程编码速度在十个模型族上比 v0.23 快 3 到 30 倍(Apple M4 Max,低端 t5-base,高端 gpt2),八线程扩展达线性 76%,且 token ID 与旧版完全一致。主要改动包括用 SIMD 位流切分替代正则、线程本地词缓存、免分配的合并循环和按批模型调用,候选版已在 crates.io 提供。
LangSmith 现已支持 TypeSafe AI 的 System One 模型 Jev 作为评估器,用于低成本评估开放性 Agent 行为并返回结构化反馈。
LangChain 团队测试了 TypeSafe AI 的 Jev 作为智能体评测器的表现。Jev 是不生成文本的 System One 决策模型,支持 Choice、Score 和布尔三类问题,官方称在分类任务上推理最快达 200 倍、成本最低至 1/400。
Introducing VC-Attention: fast and accurate low-bit attention without retraining. On MiniMax-H3, VC-Attention speeds up attention by 1.6× on B200 and 1.5× on B300 over FlashAttention-4, with better fidelity than SageAttention2. It also works with existing sparse attention methods. Two key innovations: • V-Smooth reduces value quantization error. • ExpCast-FP8 speeds up softmax. Nunchux Attention, our proprietary extension, pushes the speedup to 1.9× on B200 and 1.8× on B300. Blog: http://www.nunchux.ai/blog/attention-is-the-video-bottleneck Technical Report: http://arxiv.org/pdf/2609.15810 Joint work by researchers at MIT, CMU, UC Berkeley, Stanford, and NVIDIA.
联合国系统推出 UN System Data Commons,一个基于 Google Data Commons 构建的开源 AI-ready 知识图谱平台,将分散在联合国各机构的数据整合为单一可搜索资源。
Sakana AI 正式公布公司内部的 Frontier Intelligence Group(FIG),主张智能尚未被解决,即使当前范式可通过规模实现 AGI,也仍需探索数据与能耗效率更高的另类路径。
唐杰称,由 GLM-5.3 驱动的基础设施智能体用两周时间让 GLM-5.3-Flash 从首次在国内加速器上运行到承接全部生产流量,端到端吞吐提升 3.2 倍。
We’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline. The key was dense feedback: local correctness tests, execution traces, microbenchmarks, and end-to-end measurements that enabled targeted hypothesis testing rather than reliance on aggregate performance metrics alone. https://z.ai/blog/glm-built-its-inference-infrastructure
GitHub 用 Copilot 智能体将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,共 128 个 PR,于 8 月 21 日完成。
推荐理由:作者以第一手移植经历拆解了 AI 智能体团队完成大规模重写的具体策略、会话数据和教训,方法细节对类似工程迁移有直接参考价值。
Google 宣布与 Speakeasy 合作,将 Speakeasy 的 OpenAPI 客户端生成套件以 AGPLv3 开源。此前 Google 用于生成 GenAI SDK(Interactions、Agents、Webhooks API)的闭源生成器在 2026 年 5 月被收购并突然关停,促使双方迁移到开源方案。
OpenRouter 发布教程,演示如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据可独立运行。教程覆盖停止条件设计、按 toolCallId 返回结果、指纹计数拦截重复调用、models 参数实现有序模型回退,以及 Auto Exacto 默认按工具调用成功率重排提供商;并说明 MCP 只改变工具执行位置,循环控制仍是必要的。
推荐理由:教程给出了完整的停止条件、重复检测和模型回退实现,可用作自建 tool-calling 循环的参考骨架。
ByteByteGo 详解 LLM 应用中的检索问题,以员工询问航班取消后酒店报销为例,说明 RAG 如何从数千份文档中找到正确且仍然有效的政策条款。文章覆盖 chunking 粒度权衡、嵌入向量的语义匹配、余弦相似度等度量选择、Flat/IVF/HNSW 索引的速度与召回权衡、元数据过滤的先筛后筛取舍,以及政策更新时的版本切换和混合检索加 reranking 的最后优化步骤。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。
NVIDIA 与 SGLang 合作实现 NVFP4 KV cache,在 Blackwell 上以 4 比特存储 K/V,配合 FP8 分块缩放与 FP32 张量级缩放两级量化,打包数据加块缩放仅占 FP8 约 56% 存储。
ByteByteGo 发文解释 LLM 为何在新会话中忘记此前对话:模型本身没有持久记忆,记忆错觉由围绕模型的应用通过重建上下文实现。文章区分训练记忆、上下文窗口工作记忆和外部持久记忆,分析上下文填满后的处理方式与长对话成本,并介绍滑窗、对话摘要、结构化实体抽取、向量库检索和长期用户画像等扩展记忆的技术。
Descript 发布案例研究,介绍其视频编辑智能体 Underlord 采用 OpenRouter 后,生产模型从 1 个增至 13 个(来自 4 家模型开发方),新模型评测时间从一周以上缩短到 1-2 小时,一次 Anthropic 发布从宣布到上线只用了几小时。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,覆盖 Shopify、Salesforce、Stripe、Zoom、Xero、Zapier 等工具,产品自 5 月上线以来安装量超过 900,000 次。
推荐理由:官方公布了新增工作流与集成数量,并给出多个客户的可验证使用结果,读者可据此评估这类 Agent 产品对小型业务的落地形态。
Ling-3.0-flash-Fin 现已推出三个量化版本:FP8、FP4 和 INT4。 如果你正在构建真实的金融工作流,可以选择最契合你基础设施、内存和效率需求的版本。🧵
inclusionAI 在 Hugging Face 发布 SingProbe,一个复用 Qwen3.6-35B-A3B 隐层状态的轻量流式安全探测,逐 token 输出 8 类查询意图、不安全与幻觉风险分数,探测参数仅 4.2M。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 发布 SingProbe,一个构建在 MiniMaxAI/MiniMax-M2.7 之上的流式护栏探针,在生成过程中复用基座模型隐藏状态,对每个 token 输出查询意图、回复不安全度和幻觉风险评分。
OpenRouter 发布教程,讲解如何用独立的 judge 模型按书面评分标准自动给 Agent 输出打分,弥补确定性测试无法检查最终回答质量的问题。
推荐理由:原文给出可复用的评测方法和 Ori Eval 具体代码,覆盖评分模式选择与 judge 校准的实操细节。