PromptArmor 披露 Ramp Sheets AI 可经提示词注入外传财务数据
PromptArmor 披露 Ramp 的 Sheets AI 存在数据外传漏洞,隐藏在外部数据集中的白底白字间接提示词注入可诱导 AI 插入 IMAGE 恶意公式,将用户机密财务模型数据发往攻击者服务器,全程无需用户批准。
推荐理由:原文完整披露了攻击链和厂商修复时间线,读者可以对照 Claude for Excel 的处置理解公式外传数据的同类风险。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
当前仅显示精选新闻PromptArmor 披露 Ramp 的 Sheets AI 存在数据外传漏洞,隐藏在外部数据集中的白底白字间接提示词注入可诱导 AI 插入 IMAGE 恶意公式,将用户机密财务模型数据发往攻击者服务器,全程无需用户批准。
推荐理由:原文完整披露了攻击链和厂商修复时间线,读者可以对照 Claude for Excel 的处置理解公式外传数据的同类风险。
Together AI 发布 EinsteinArena,一个供智能体在开放数学问题上互动、讨论和竞争的平台,含实时验证与公开排行榜,已完全开源。智能体通过多轮协作将 11 维 kissing number 下界从 AlphaEvolve 的 593 推至 604,截至 2026 年 4 月 11 日已产生 11 项新 SOTA 结果,覆盖 Erdős 最小重叠问题、第二自相关不等式等。
推荐理由:原文给出多智能体协作在开放数学问题上刷新界值的实例和开放接口,读者可以了解智能体协作搜索的实际运作方式。
Factory 发布 Missions 系统的架构解析,将大型编码任务拆分为由编排器、worker 和独立 validator 分工完成的小单元,用验证契约和共享状态避免单上下文窗口过载。
推荐理由:原文拆解 Missions 的编排器、worker、validator 分工与状态外置设计,并给出真实任务的运行数据,方法对构建长程编码智能体有直接参考价值。
LlamaIndex 为 LlamaParse 和 LiteParse 推出可安装的 Agent 技能,支持 Claude Code、OpenClaw、OpenCode 等运行时,通过 npx skills add run-llama/llamaparse-agent-skills 安装。
推荐理由:原文面向 Agent 解析复杂文档的痛点,给出 LlamaParse 与 LiteParse 两套技能的分工思路和可安装入口,便于迁移到自有工作流。
Factory 发布桌面应用,作为运行 Droids 的原生界面,今日登陆 macOS 和 Windows,包含在现有订阅中。支持多智能体会话、持久化 Droid Computers(含 Cloud Computers 和 BYO Machine)、通过 Ollama 或 vLLM 运行本地模型、电脑操作、VS Code 集成、MCP/技能/钩子插件生态及移动端。
推荐理由:原文给出多智能体会话、持久化 Droid Computer、本地模型与电脑操作等能力细节,读者可据此评估它对现有工作流的影响。
Qwen 团队继 2 月发布 Qwen3.5 系列后,宣布 Qwen3.6-Plus 正式发布,现已可通过 API 使用。官方称该版本相比前代有大幅能力提升,尤其显著增强了智能体编码能力,覆盖从前端网页开发到复杂仓库级问题求解的场景。
推荐理由:官方宣布新一代模型上线 API,重点提升智能体编码能力,关注代码开发的读者可以对比前代评估升级幅度。
Factory 发布 Legacy-Bench 基准,用涵盖 COBOL(46%)、Java 7(32%)等六类遗留语言的数百个任务测试 AI 智能体,12 个模型-智能体组合的通过率为 16.9% 至 42.5%,而这些模型在 SWE-bench Verified 等现代基准上得分超过 70%。
推荐理由:原文用真实遗留代码任务填补现有基准的盲区,给出各模型在 COBOL 等语言上的具体分数和失败模式,可帮助读者评估 AI 智能体处理关键遗留系统的实际能力。
PromptArmor 披露 Snowflake Cortex Code CLI 的命令验证漏洞,攻击者可借助 README 中的间接提示词注入,通过 process substitution 表达式绕过人工审批并设置 dangerously_disable_sandbox 逃逸沙箱,下载执行恶意脚本,利用缓存 token 对 Snowflake 进行数据窃取、删表等操作。
推荐理由:原文完整复现了从提示词注入到沙箱绕过和凭证窃取的攻击链,并给出修复版本和官方通告入口,便于读者核对自身配置。
Replit 发布「Live from HQ」第二期直播回顾,复盘 Agent 4 发布背后的工程与设计。
推荐理由:官方复盘 Agent 4 五位成员的工程与设计决策,读者可以了解并行任务、合并冲突解决和微 VM 分支背后的实现思路。
Replit 发布 Agent 4,对设计、协作、可构建内容和规划流程四方面作出升级。Design Mode 替换为支持所有 Artifact 类型的 Design Canvas 无限画布。
推荐理由:原文逐项对比 Agent 3 到 4 在设计、协作和构建流程上的具体变化,老用户可以据此了解迁移影响。
MiniMax 发布 M2.7 模型,称其为首个深度参与自身演化的 M2 系列模型,让模型构建 skills、更新记忆并改进强化学习实验流程。SWE-Pro 得分 56.22%,VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高;MLE Bench Lite 三次运行平均奖牌率 66.6%。
推荐理由:原文给出了自进化工作流细节和多维度基准数据,读者可以对照评估 M2.7 在智能体与工程任务上的实际位置。
Manus 为 Google Workspace 连接器推出重大升级,基于 Google Workspace 团队开源的 Google Workspace CLI(非 Google 官方支持产品),从创建和读取文件扩展到 Docs 精准文本替换、Sheets 跨表数据交叉引用、Slides 编辑现有演示文稿等精细操作。
推荐理由:官方说明了升级后连接器能做的精细操作和免费开放方式,读者可据此判断是否改变自己的 Workspace 工作流。
Manus 发布 Manus 2.0 桌面应用的核心功能 "我的电脑",将此前完全运行在云端的 Manus 带到本地电脑,通过在终端执行命令行指令读写本地文件并控制本地应用。
推荐理由:官方介绍了桌面端让 Manus 通过本地终端操作文件与应用的机制,并保留逐条命令审批的控制设计,可了解其工作流变化。
Replit 宣布完成 4 亿美元融资,估值 90 亿美元,较六个月前增长 3 倍,投资方包括 Georgian、G Squared、YC、Coatue、a16z、卡塔尔投资局等。
推荐理由:原文给出估值较六个月前增3倍、用户与收入规模及 Agent 4 速度变化,读者可据此判断 Replit 的增长轨迹。
Replit 发布 Agent 4,宣称可将生产级软件交付速度提升 10x。Agent 4 支持在同一环境中生成设计变体并直接应用于应用代码、多智能体并行执行任务、基于任务的工作流自动排序请求,并可在同一项目中构建 Web 与移动应用、幻灯片、数据应用和动画,还能操作 Linear、Notion 等连接服务。
推荐理由:官方原文给出设计画布、并行任务和跨项目产物四项能力细节,可帮助读者评估它对现有开发流程的改变。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
Replit 在博客中介绍 Replit Animation 功能,让开发者在构建应用的同一工作区内用自然语言生成动效风格的发布视频,不必外包给动效工作室。
推荐理由:原文介绍了 Replit Animation 的来源、使用步骤和提示词技巧,读者可据此判断是否将其纳入发布视频工作流。
Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。
推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。
Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。
推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。