inclusionAI 发布 SingProbe 流式安全探测,基于 Qwen3.6-35B-A3B
inclusionAI 在 Hugging Face 发布 SingProbe,一个复用 Qwen3.6-35B-A3B 隐层状态的轻量流式安全探测,逐 token 输出 8 类查询意图、不安全与幻觉风险分数,探测参数仅 4.2M。
inclusionAI 在 Hugging Face 发布 SingProbe,一个复用 Qwen3.6-35B-A3B 隐层状态的轻量流式安全探测,逐 token 输出 8 类查询意图、不安全与幻觉风险分数,探测参数仅 4.2M。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.5-122B-A10B 上的内在流式安全护栏探针,复用基座模型隐藏状态,在每个 token 上输出 8 类查询意图、回复不安全度和幻觉风险分数,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-0.8B-singprobe,一个基于 Qwen/Qwen3.5-0.8B 隐藏状态的流式安全探针,可在生成过程中逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
inclusionAI 发布基于 Qwen/Qwen3.5-397B-A17B 的流式安全探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.8-27B-singprobe,这是一个构建在 Qwen/Qwen3.8-27B 上的内在流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 推出 SingProbe,一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复安全性和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-4B-Instruct-2507 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 GLM-5.3 的流式安全探针 GLM-5.3-singprobe,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-4B-singprobe,这是一个构建在 Qwen/Qwen3.5-4B 上的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-9B-singprobe,这是一个构建在 Qwen/Qwen3.5-9B 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个基于 google/gemma-4-31B-it 的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 gpt-oss-120b-singprobe,这是构建在 openai/gpt-oss-120b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 stepfun-ai/Step-3.7-Flash 上的内在流式护栏,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的流式安全探针,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Llama-3.1-8B-Instruct-singprobe,一个基于 meta-llama/Llama-3.1-8B-Instruct 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3-8B-singprobe,这是构建在 Qwen/Qwen3-8B 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 gpt-oss-20b-singprobe,这是构建在 openai/gpt-oss-20b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 MiniMaxAI/MiniMax-M2.7 之上的流式护栏探针,在生成过程中复用基座模型隐藏状态,对每个 token 输出查询意图、回复不安全度和幻觉风险评分。
Perplexity 正使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
OpenRouter 发布教程,讲解如何用独立的 judge 模型按书面评分标准自动给 Agent 输出打分,弥补确定性测试无法检查最终回答质量的问题。
推荐理由:原文给出可复用的评测方法和 Ori Eval 具体代码,覆盖评分模式选择与 judge 校准的实操细节。
Claude API 的 Messages API 新增按需压缩对话功能,以 compact-2026-09-04 beta 头开启。发送顶层 compaction 参数后返回带签名的压缩块概括所发消息,后续请求可先发该块替代原消息,支持后台运行、保留最近轮次原文,且在支持保留 thinking 的模型上已保留轮次的 thinking 可保持有效。
推荐理由:原文给出了 compaction 的调用方式和 beta 头参数,开发者可据此评估在长对话场景里如何按需压缩上下文。
LangChain 博客总结医疗与生命科学行业智能体规模化经验:76% 受访机构将 tracing、评估和支出可见性列为扩大智能体自主权的前提,49% 正在建设公司级智能体平台或“agent factory”,33% 聚焦已有纸质记录的受监管文档与后台流程,26% 在运行或构建面向患者和会员的对话式智能体(含语音),另有 26% 尝试让非工程师在中央护栏内构建智能体。
Sakana AI 提出 PC-ALM,一种仅靠局部动力学、无需反向传播即可训练 1000 层神经网络的局部学习替代方案。该方法将预测编码推广为使用增广拉格朗日,引入对偶神经元(拉格朗日乘子)参与层内动力学,使每层成为 PI 反馈控制系统以最小化局部预测误差。PC-ALM 能将信号传播到近乎任意深度,在标准预测编码难以学习的深层窄网络中尤其有效,并可能为神经形态硬件上的深度学习提供参考。
LangChain 开源其 Paid Media Agent 并复盘构建过程,该 Agent 驻留 Slack,用于管理跨五个付费渠道的广告活动。六个月内付费媒体从 0 做到占营销管道的 20%,CPL 从 6 月到 8 月下降 30%。
推荐理由:原文给出了 Agent 工程的具体设计决策和成本数据,读者可以迁移其上下文分层和权限设计方法到自己的 Agent 项目。
GitHub 日本与韩国营销负责人 Tomoko Tanaka 撰文分享如何不写代码,用 GitHub Copilot 把活动运营从策划到会后跟进全流程自动化。
推荐理由:作者以自身营销流程为例,展示如何用 runbook 加 Copilot 在 GitHub 上搭建自动化,方法可迁移到其他重复性工作。
匿名混合现实艺术家 VOIDZ 借助 Runway 的 Seedance 2.0,将原本受限于 10 到 15 秒的 3D 制作流程,扩展成 95 秒纪录片《Ends Meat》。
Cognition 借助 GPT-6 Astra 提升了 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
英国王立協会《Philosophical Transactions of the Royal Society A》发布特集号「World Models in Natural and Artificial Intelligence」,Sakana AI CEO 的 David Ha 作为卷首文章共著者参与。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。
Google 推出 autofinetune,将自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音,一个 API key 即可以相同请求结构调用 Mistral Voxtral Mini TTS、xAI Grok Voice TTS 1.0、Microsoft MAI-Voice-2 等多家模型。
OpenRouter 发文解释零数据保留(ZDR):AI 提供商处理完提示词并返回响应后不再存储,但数据仍会到达提供商并由模型处理。在 OpenRouter 上可通过账户设置、guardrails 或请求中的 provider.zdr 字段强制启用 ZDR,该策略仅覆盖提供商侧推理留存,应用日志、插件工具及响应缓存需另行控制。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
GitHub Copilot app 新增内置 diff、终端和浏览器面板,让新手不用离开应用即可审查 agent 改动、运行命令并预览界面。
Runway 分享其实时视频生成研究的整体思路,目标是把视频模型从整段生成转向优化首帧时间和随提示流式输出。方法上基于 Gen-4.5 等基础模型做后训练,先将架构改为时间因果、逐帧自回归生成,再通过两阶段分布匹配蒸馏(先 off-policy 后 on-policy)把每帧压缩到几步推理,配合渐增序列长度课程减少误差累积,同时针对并发会话构建推理服务栈。
César de la Fuente 的实验室利用 Codex 和 ChatGPT 在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
Google Search 的 AI 功能可帮跑者备战比赛:AI Mode 配合 Canvas 工具生成个性化训练计划,连接 YouTube Music 账号后还能定制跑步歌单。选购装备时,Search 依托超过 600 亿条商品信息的 Shopping Graph 提供推荐、库存对比和本地可用性。
Sakana AI 发布 Fugu Max 和 Fugu Ultra v2,用多智能体编排同时优化成本与性能。
推荐理由:原文给出具体基准成绩、定价对比和 API 升级方式,读者可据此评估编排架构在成本与性能上的实际位置。
OpenAI 推出 ChatGPT Work 中的 Data agent,可用自然语言连接公司数据、挖掘洞察并借助 AI 构建交互式仪表盘。