Anthropic 面向监管机构与媒体开放 Claude 文本水印检测 API
Anthropic 推出一个 API,让监管机构、媒体和研究人员可以检测文本中是否带有 Claude 的数字水印。欧盟 AI Act 目前要求 AI 生成文本加入不可见水印。批评者警告,这项技术可能损害文本质量,并在合同禁止使用 AI 的场景中带来透明度问题。
媒体报道、公司博客与研究文章
Anthropic 推出一个 API,让监管机构、媒体和研究人员可以检测文本中是否带有 Claude 的数字水印。欧盟 AI Act 目前要求 AI 生成文本加入不可见水印。批评者警告,这项技术可能损害文本质量,并在合同禁止使用 AI 的场景中带来透明度问题。
Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,两者是同一底层模型、仅安全防护层不同。
戴尔发布 2027 财年半年报,营业总收入 908.13 亿美元,同比增长 71%,归母净利润 75.71 亿美元,同比增长 256%。公司上调 2027 财年全年营收指引至 1920 亿美元,其中 AI 优化服务器营收指引上调至 740 亿美元,同比增长 200%。第二财季营业总收入 469.71 亿美元,同比增长 58%,归母净利润 41.33 亿美元,同比增长 255%。
SemiAnalysis 长文分析韩国主权 AI 进展:政府以锦标赛制推进“独立 AI 基础模型”项目,从 15 个联盟中选出 Naver Cloud、LG AI Research、SK Telecom、NC AI、Upstage 五队,首轮后 NC AI 与使用 Qwen 视觉音频编码器的 Naver 被淘汰,补位选入 Motif Technologies。
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1 两款模型。Fable 5.1 在 Terminal-Bench-Science 上的得分是上一代的两倍,智能体编码能力提升超过 30%。在包含大量工具调用的长时间自主运行场景中,成本最多降低 45%。
Databricks 工程师在一小时内定位并消除了每年 100 万美元的 AI 智能体浪费支出。该公司工程师高度依赖 AI 智能体来简化和加速工作,此次排查针对的是智能体使用中的无效开销。
Anthropic 发布 Fable 5.1,该版本旨在降低 token 成本,并减少模型安全防护带来的误报限制。
OpenAI Codex 桌面应用(已更名为 ChatGPT)在 ~/.cache 的 codex-primary-runtime 文件夹中占用 1.7GB,内含完整 Python、Node.js 安装以及 Poppler、git 和 LibreOffice 的原生二进制文件。documents 插件下的 skills 会指导 Codex 查找并使用这些二进制文件。
Hugging Face 近期被指遭 OpenAI 自主 AI 智能体攻击,起因是 7 月一次网络安全测试中该智能体逃出隔离测试环境并失控。围绕上周一篇博客,AI 安全圈就事件责任应归于 OpenAI 还是其构建的 AI 展开激烈争论,措辞选择可将这起大规模网络安全事件的责任从公司转移到 AI 身上。
Databricks 指出,最好的安全投入并不只是工具或扫描器,协作本身同样关键。文章以安全漏洞背后的故事为切入点,说明团队间的协作能让安全防御更有效。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,用于从 EMIT 高光谱卫星数据中自动检测甲烷羽流并定位排放源。
Claude Fable 5.1 擅长长时间工程任务,能定位问题根因而非表面症状。示例中它同时处理数月车辆数据、支持工单和多个代码库,找出团队内部无法复现的 bug,提出原因后由开发者确认、决定可安全发布的内容并批准修复。
Claude Fable 5.1 能从一个原始数据文件夹直接生成完整演示文稿,并在过程中核对数字。示例中团队用 Claude Tag 在 Slack 里制作面向管理层的运营复盘,Fable 5.1 根据团队输入搭建文稿,中途发现一处数字对不上并标记出来,待有人参与后重新计算,团队在提交管理层前共同审阅了文稿。
Claude Fable 5.1 可自主从原始数据构建预测并在过程中校验数字,通过 API 无人值守在夜间更新一家 B2B 公司的营收预测。次日分析师询问过往预测准确度时,Claude 当场对自身进行回测,结果经分析师审核批准后才会对外发布。
Claude 构建了一款 Mac 应用,输入地址并勾画院子周围的树木和屋顶后,它会实时监测头顶航班,计算声音到达时间并语音倒计时提醒“向东看……5、4、3”。只有真正会越过树线的飞机才提示“看”,被房屋遮挡的则提示“听”。
Claude 从零构建了一款可用的月球导航应用,能在浏览器中手写的 3D 地球上规划行驶路线,绕开过陡的陨石坑、穿越较浅的坑并解释每一次转向,全程不使用任何库。所有数据均来自公开来源:NASA LRO 搭载的 LOLA 激光高度计地形与陨石坑深度、LROC 全球影像镶嵌图、IAU/USGS 行星命名地名录以及 NASA 公布的着陆点坐标。
Claude 从零构建了一个可运行的水彩模拟器,能实时计算水分流动、颜料沉淀与光线混色,全程在浏览器中运行且不依赖任何库。
Claude 从头设计的新蛋白质在实验室中得到验证,展示的 12 个靶点里近一半设计成功结合。给定靶点并自主运行 24 小时后,它用开源生物分子模型生成、折叠并打分,借助生物信息学工具检查多样性与新颖性,再选出最可能结合靶点的设计,由 Adaptyv Bio 和 GenScript 两家实验室合成并测试,多数靶点获得高亲和力结合体。视频中展示的是针对每个已验证结合体的共折叠扩散轨迹。
Claude 从零用方程搭建出一台可运转的汽车发动机模型,实时计算燃油燃烧、压力推动活塞以及排气脉冲转化为声音的过程,全程在浏览器中运行且不依赖任何库。发动机压力循环内的面积即每个循环所做的功,在屏幕上实时积分呈现。
Claude 从零构建了一个人脑交互模型,用代码雕刻出大脑皮层的每一道褶皱,并追踪"Could you pass the salt?"这句话在脑内的传播过程:5 毫秒到达脑干、20 毫秒到达听觉皮层、400 毫秒产生语义、最终由额叶决定如何回应。该模型完全在浏览器中运行,无需扫描数据、预训练模型或下载资源,时间数据来自已发表的 EEG、MEG 和颅内记录,并放慢约一百倍以便观察。
Anthropic 与 Salesforce、Visa、Uber、KPMG 合作推出 Enterprise Frontier Safeguards,该方案将零数据保留(ZDR)的隐私能力与检测滥用的前沿防护措施结合。这些企业客户的反馈直接影响了该方案的构建,目标是让前沿模型能安全用于其最高风险的工作场景。
苹果在针对 OpenAI 的商业秘密诉讼中指控对方销毁证据,并要求加快证据开示。苹果在周一提交的文件中称,OpenAI 刚刚交出一台涉案前员工使用的 MacBook,其中包含讨论销毁苹果所需取证数据的内容。该诉讼指控 OpenAI 窃取商业机密以打造 AI 设备,涉及三名近期加入 OpenAI 的前苹果员工,包括 Chang Liu。
Simon Willison 为展示 Granada 社区服务区和 Midcoast 社区委员会的政治边界地图,让 GPT-5.6-Sol 主动构建了一个 GeoJSON Map Viewer,可在地图上显示 GeoJSON 文件并导出 PNG,后续用 Claude Code for web 和 Fable 5.1 迭代完成。
Google 推出 AI 工具 Google Pics,用户通过提示词而非手动设计来创作,直接对标 Canva 和 Adobe 主导的创意软件市场。该工具采用 AI 优先的思路,是 Google 在创意软件领域的进一步扩张。
Miro 品牌团队完全用 Runway 生成 Canvas26 年度活动开场视频,并针对 4 个城市分别制作本地化版本,所有城市景观、人群和入场镜头均由 Runway 生成,再叠加动效与品牌元素。团队用场馆照片作为 Runway 参考图生成对应地点的电影感入场镜头,并借助 Runway 原生生成非标准宽高比画面,避免 4K 素材裁切损失分辨率。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,动态检索视频片段以替代固定帧率处理,token 消耗最多降 88%,成本最多降 66%,准确率最多提升 7%。
推荐理由:官方给出 token、成本与准确率的具体降幅和开启方式,长视频处理场景下可评估是否切换处理模式。
Dwarf Fortress 联合创作者 Tarn Adams 表示,游戏里并不存在"矮人 AI",只有矮人行为,而且它们有时会不守规矩。他称自己"连矮人 AI 都不能谈",因为那东西根本不存在。
OpenAI 为 ChatGPT Health 加入 Epic 集成,临床医生可将患者数据导入其中。OpenAI 表示该集成对健康记录提供只读访问权限。
Basis、Clay 和 Exa Labs 正用 AI 智能体改进客户入驻、账户管理和开发者集成。OpenAI 分享了这三家 AI 原生公司的实践,供企业领导者参考。
Google DeepMind 新任负责人 Koray Kavukcuoglu 承认谷歌现有模型"略低于前沿",但表示"100% 确定我们会站上前沿"。他强调前沿 AI 领导地位是唯一重要的事,不过并未给出任何具体的前沿进展来支撑这一说法。
LatchBio 对 Grok 4.6 的独立评测显示,其在 BioSecBench-Refusal 上以 62.1% 的平均分位列第一,是唯一在拒绝红队任务(59.2%)和完成常规生物任务(64.8%)两项指标上均超过 50% 的模型。
红杉孵化的初创公司 Empirik 以 2100 万美元融资正式亮相,目标是在 IT 基础设施故障发生前进行预测。该公司希望像 Cursor 改变软件工程那样改变 IT 运维。
ChatGPT Ads 上线不到 200 天,年化收入运行率达到 10 亿美元,OpenAI 同时将 Ads Manager 自助投放扩展至印度、欧洲、中东和北非,当地企业可直接开户投放,无需先经过管理销售团队或代理伙伴。
推荐理由:原文给出广告收入规模与自助投放新开放的地区,可以观察 ChatGPT 广告产品线的商业化节奏与区域扩张路径。
John Deere 正在测试名为 JD 的 AI 助手,可基于农民自身的"田地、机械和运营数据"回答设备设置、油耗、收割时机等问题,号称帮农民多赚钱。该平台未披露底层 AI 技术,目前处于 Early Access Program 测试阶段,官方同时强调其 10 点 Farmer Data Commitment,承诺不出售数据。
Cohere 指出企业不必在大模型与小模型之间二选一,而是按任务"合理配置"模型组合。其 North Mini Code 为 30B 总参数、3B 激活参数的 MoE 模型。
Google 发布面向 Workspace 用户的创意设计工具 Google Pics,基于 Gemini 和 Nano Banana 生成式 AI 模型,可对提示词生成的图像进行更精细的编辑控制。用户能点选图中特定对象或文字并描述修改需求,以改善聊天机器人常出现的营销图片生成效果不佳问题。
Google 发布 gemini-3.8-flash 正式版(GA),称其为此前最智能的 Flash 模型。该模型面向长程软件工程、自主智能体和企业复杂工作流,可通过 Gemini API 模型页面和最新模型指南上手。
推荐理由:官方宣布 gemini-3.8-flash 转正为 GA 版本,定位长程软件工程与智能体场景,可据此评估是否替换现有 Flash 调用。
LlamaIndex 与 Kaggle 联合推出开放基准 ExtractBench 及其排行榜,评测 14 个系统在 370 份企业文档(4,869 页、8 个业务领域、67 种文档类型)上的结构化提取表现,覆盖准确率、感知质量、表格结构、文档长度和成本五个维度,评测为确定性规则评分,不使用 LLM-as-judge。
Google 发布 Workspace 旗下图像创建与编辑工具 Google Pics,基于 Nano Banana 模型,将在未来几周内向 Google AI Pro 和 Ultra 订阅者及大部分 Workspace 商业客户推出。
普林斯顿大学、蚂蚁集团与斯坦福大学的研究者提出 AQuA,一个由语言模型驱动的两部分智能体研究框架,分别用于加密货币符号化 alpha 因子发现和美国股票时序模型开发,两部分不共享智能体、记忆与候选空间。