最新精选 第 121–140 条 · 共 231 条 13:43 Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。
推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。
13:43 Mistral AI 开放 La Plateforme 平台服务测试,提供 mistral-tiny、mistral-small、mistral-medium 三个对话端点和一个 Mistral-embed 嵌入端点。
推荐理由:Mistral 开放平台服务测试,给出三个对话端点与一个嵌入端点的性能价格取舍和接入方式,可作模型选型参考。
13:43 Mistral AI 发布新一代旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,具备 32K token 上下文窗口与原生函数调用能力。
推荐理由:官方给出与 GPT-4 的基准位次和 Azure 上线渠道,读者可据此了解这款欧洲旗舰模型的定位。
13:43 Mistral AI 发布 24B 参数的 Mistral Small 3,以 Apache 2.0 许可同时放出预训练和指令微调 checkpoint。官方称其指令版与 Llama 3.3 70B instruct 相当,同硬件下速度超过 3 倍,MMLU 准确率超 81%,延迟 150 tokens/s。
推荐理由:官方给出了 24B 模型的对标结果与本地部署门槛,读者可据此判断它在开源替代中的位置。
08:00 OpenRouter 发布 Activity 仪表盘和 Analytics API,可按 Agent、模型、用户和请求维度查看支出、token 用量、缓存命中率和延迟等指标。
推荐理由:原文给出仪表盘各项功能、Analytics API 端点和内部降本案例,读者可以据此评估如何排查自家 Agent 用量成本。
22:31 LangChain 宣布 Managed Deep Agents 进入公开测试,开发者可用 Python 或 TypeScript 编写 Deep Agent 并本地测试,再用 mda deploy 一条命令部署到 LangSmith 托管运行时。
推荐理由:原文列出托管运行时接管的持久化、沙箱与记忆等基础设施,并说明用户仍可控制的部分,便于判断是否把原型迁到生产。
22:31 LangChain 的 Deployed Engineer 介绍了其为 Kubernetes 部署构建的自主 SRE 智能体,目标是缩短故障排查与修复时间。
推荐理由:LangChain 公开了自建 SRE 智能体的架构取舍,读写分离与人工审批门的设计可迁移到其他生产运维场景。
22:31 LangChain 用自家 145 个多步任务的 Deep Agents 评测套件测试 NVIDIA 开源路由库 Switchyard,只有 7% 的模型调用被送到 Claude Opus 4.8,其余 93% 由 30B 的 Nemotron 3.5 Lightning 处理。
推荐理由:用同一套 agent 评测套件对比单模型与路由方案,并给出判断是否值得上路由的成本公式。
22:31 LangChain 在博客中把 AI 智能体定义为使用大语言模型决定应用控制流的系统,自治程度取决于模型掌握多少控制流。文章用六级图谱区分工作流与智能体,从手写代码、单次 LLM 调用、链式调用一直到能自行构建并记忆工具的完全自主智能体,并指出模型控制权越多,对可观测性、评测、记忆、权限和安全执行的要求越高。
推荐理由:文章给出以控制流归属划分智能体的定义和六级自治图谱,并列出落地生产所需的基础设施与评测方法。
22:31 LangChain 复盘 Lyft、Fastweb + Vodafone 和 LATAM 航空三家企业客服智能体的生产实践。
推荐理由:三家企业的生产案例给出了评测、观测与架构调整的具体做法,便于对照自身客服智能体的上线流程。
12:33 inclusionAI 发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,在关键基准上追平或超过上一代 1T 级旗舰 Ring-2.6-1T。
推荐理由:模型卡给出混合线性注意力架构与多精度量化对比,读者可据此评估长上下文智能体任务的部署成本。
20:58 DeepSeek 开源了开发者预览版智能体框架 DeepSeek Harness,它是一套用来构建、运行和扩展智能体的 SDK 与应用框架,默认可连接 DeepSeek 模型,开源地址在 GitHub。
推荐理由:作者以提前内测的第三方身份跑通游戏与 3D 动画案例,展示了这套插件化智能体框架的组装方式与能力边界。
20:00 Cursor 推出 builds 功能,在后台预先准备可直接使用的开发环境副本,让云端智能体启动最高快 3 倍;Cursor 内部环境启动快了 10 倍,首个 token 生成快了 3 倍。builds 默认每小时创建一次,智能体始终基于最新的成功构建启动,构建失败时继续沿用上一次成功构建,工作不中断。8 月 17 日起,所有新建和现有环境将默认使用 builds,且不额外收费。
推荐理由:Cursor 公布云端智能体启动变快 3 倍的后台预构建机制,并说明迁移与调试方式。
15:08 inclusionAI 发布 Ling-3.0-flash 原生混合线性推理模型,总参数 124B、激活 5.1B,官方称其关键基准上追平或超过前代 1T 级旗舰 Ring-2.6-1T。
推荐理由:官方给出 124B 总参数、5.1B 激活的架构与量化评测数据,可供判断长上下文推理的部署成本。
11:33 安全公司 CloudSEK 与 Hudson Rock 披露,今年 3 月爆发的 LiteLLM 供应链投毒事件在约 40 分钟攻击窗口内波及全球超 2,500 个组织,约 195TB 密码凭据被外传。
推荐理由:披露的泄露数据类型与受影响机构清单,便于读者核对自身 AI 网关上游依赖的风险敞口。
21:00 WhatsApp 推出可选功能 Scam Alert,在设备端用机器学习模型对非联系人消息做诈骗分类,消息内容不上传、不自动上报。模型版本经 Cloudflare 签名并发布到第三方 append-only 透明账本,遥测经基于 TEE 的机密联邦分析管线以差分隐私聚合方式回传,用户可在应用内查看 Scam Alert Activity 日志,功能正在 Beta 小范围推送。
推荐理由:原文给出了 Scam Alert 的端侧架构与可验证机制细节,安全研究者可以据此评估其在端到端加密下的实现。
08:00 OpenRouter 发布实时网络搜索基准榜单,覆盖 BrowseComp、DeepSearchQA、WideSearch 和 HLE 四套评测,比较模型、引擎(Exa、Parallel、Perplexity 及 OpenAI、Anthropic、Google 原生搜索)、搜索方法与预算的组合。
推荐理由:原文用四套实时榜单量化搜索预算、引擎与模型对质量和成本的影响,还给出可直接套用的参数配置方法。
00:00 SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。
推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。
20:19 Linear 官方详解 Linear Agent 的构建思路:不为 Agent 设计固定路径,而是通过系统提示词、工具设计、对 Linear 产品的语义建模、system skills 按需加载和自研 harness 来划定边界。
推荐理由:Linear 官方复盘 Agent 的设计取舍,涉及系统提示词、工具设计、system skills 和自研 harness,方法可迁移到类似 Agent 构建。
08:00 OpenRouter 发布重大更新的 Auto 路由器(openrouter/auto),基于平台每周超 55T token 的真实消费数据选择模型,并已向所有用户开放。
推荐理由:基于 55T 周消费数据的市场化路由思路,附各任务基准与成本对比,读者可据此评估是否切换自己的 Auto 路由配置。
上一页 1 … 5 6 7 8 9 … 12 下一页