最新精选
第 261–280 条 · 共 280 条LlamaIndex 为 LlamaParse 和 LiteParse 推出可安装的 Agent 技能,支持 Claude Code、OpenClaw、OpenCode 等运行时,通过 npx skills add run-llama/llamaparse-agent-skills 安装。
推荐理由:原文面向 Agent 解析复杂文档的痛点,给出 LlamaParse 与 LiteParse 两套技能的分工思路和可安装入口,便于迁移到自有工作流。
Factory 发布桌面应用,作为运行 Droids 的原生界面,今日登陆 macOS 和 Windows,包含在现有订阅中。支持多智能体会话、持久化 Droid Computers(含 Cloud Computers 和 BYO Machine)、通过 Ollama 或 vLLM 运行本地模型、电脑操作、VS Code 集成、MCP/技能/钩子插件生态及移动端。
推荐理由:原文给出多智能体会话、持久化 Droid Computer、本地模型与电脑操作等能力细节,读者可据此评估它对现有工作流的影响。
Cohere 发布开源 ASR 模型 Cohere Transcribe,在 HuggingFace Open ASR Leaderboard 以平均 WER 5.42% 排名第一,超过 Whisper Large v3、ElevenLabs Scribe v2 和 Qwen3-ASR-1.7B。
推荐理由:原文给出 Open ASR Leaderboard 排名、WER 数据和部署方式,读者可以据此评估其相对 Whisper 等方案的实用价值。
PromptArmor 披露 Snowflake Cortex Code CLI 的命令验证漏洞,攻击者可借助 README 中的间接提示词注入,通过 process substitution 表达式绕过人工审批并设置 dangerously_disable_sandbox 逃逸沙箱,下载执行恶意脚本,利用缓存 token 对 Snowflake 进行数据窃取、删表等操作。
推荐理由:原文完整复现了从提示词注入到沙箱绕过和凭证窃取的攻击链,并给出修复版本和官方通告入口,便于读者核对自身配置。
Manus 发布 Manus 2.0 桌面应用的核心功能 "我的电脑",将此前完全运行在云端的 Manus 带到本地电脑,通过在终端执行命令行指令读写本地文件并控制本地应用。
推荐理由:官方介绍了桌面端让 Manus 通过本地终端操作文件与应用的机制,并保留逐条命令审批的控制设计,可了解其工作流变化。
Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。
推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
Replit 发布博文,介绍其为 Replit Agent 设计的决策时引导(decision-time guidance)机制,用轻量多标签分类器在关键决策点注入简短情境化指令,替代静态系统提示词,将可控引导从 4–5 条静态提醒扩展到数百条。
推荐理由:Replit 自述其 Agent 的决策时引导机制,包含注入位置对比实验和缓存成本数据,方法对同类 Agent 工程有可迁移性。
SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。
推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。
Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。
推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。
LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。
推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。
PromptArmor 发布对 Google Antigravity 的安全分析,演示通过藏在网页指南中的间接提示词注入操纵 Gemini 调用浏览器子代理,将用户 IDE 中的凭证和代码外泄到攻击者控制的 webhook.site 地址。
推荐理由:原文完整拆解了从间接提示词注入到浏览器子代理外泄凭证的攻击链,并指出默认白名单和设置可被绕过,具备可验证的技术细节。
MiniMax 开源并发布面向 Agent 和编码场景的模型 MiniMax M2,API 定价为每百万输入 tokens $0.30/¥2.1、输出 $1.20/¥8.4,为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍,TPS 约 100。
推荐理由:官方给出了 M2 的定价、推理速度、基准成绩与部署方式,读者可据此评估其在 Agent 工作流中的成本与性能权衡。
Thinking Machines Lab 发布 John Schulman 署名的研究,发现在满足两个条件时 LoRA 的样本效率与最终性能与全量微调相当:一是应用于全部权重层尤其是 MLP/MoE 层,二是不受容量限制即数据集规模不超过 LoRA 参数容量。
推荐理由:原文系统实验给出 LoRA 追平全量微调的两个条件和最优学习率为其 10 倍等可操作结论,可直接指导微调选型。
Thinking Machines Lab 发文指出,LLM 推理不确定性的主因不是并发与浮点加法,而是服务器负载变化导致批大小改变,使缺乏批不变性的内核产生不同数值结果。
推荐理由:原文指出 LLM 推理不确定性的真正来源是批大小变化破坏了批不变性,并给出可实现确定性推理的内核方案与代码。
Factory 发布实践文章,主张把架构、边界和规范编码为 lint 规则,让 LLM Agent 在代码生成循环中获得自动反馈并自我修正,将“lint green”作为完成标准。文章给出可检索性、代码组织、架构边界、安全、测试、可观测性等规则类别,介绍 lint 驱动的大规模迁移方法,并说明 AGENTS.md 负责“为什么”,linting 提供机器可执行的保证。
推荐理由:文章给出把架构规范编码为 lint 规则的完整类别清单和落地流程,可直接迁移到自己团队的 Agent 开发工作流。
Factory 宣布 Droids 软件开发智能体正式开放(GA),覆盖从工单到生产代码的整个软件开发生命周期。
推荐理由:Factory 宣布 Droids 正式开放,覆盖从编码到 on-call、工单管理的整个软件开发生命周期,价格和集成方式对团队选型有参考价值。
Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、成本低约 8 倍和更易部署的新级别模型。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准数字和 $0.4/$2 定价,读者可以据此评估它在企业部署中的性价比。
DeepSeek API 创新采用硬盘缓存技术,价格再降一个数量级。更新详情见官方文档 API 上线硬盘缓存,发布于 2024/08/02。
推荐理由:官方宣布 API 采用硬盘缓存并称价格再降一个数量级,读者可以据此评估调用成本的下降幅度。