Claude 隐形水印被光速破解,GitHub 一天狂揽 2.6k 星
开发者 Guillaume Meyer 发布 watermarks-remover 技能,用于清除 Claude 等模型生成内容中的隐形水印,上线一天在 GitHub 获 2.6k stars,一天内更新四个版本。
按公众号阅读文章与观点
开发者 Guillaume Meyer 发布 watermarks-remover 技能,用于清除 Claude 等模型生成内容中的隐形水印,上线一天在 GitHub 获 2.6k stars,一天内更新四个版本。
智谱发布 GLM-5.3,基座与 GLM-5.2 相同,通过对 743B 基础模型后训练提升编程与 Agent 能力。
Vercel Labs 发布实验性系统编程语言 Zero,定位为更便于 AI 智能体使用和修复的系统语言,目前已发布 v0.3.4,GitHub Star 超过 5200。
Composio 让同一款 DeepSeek V4 Flash 分别运行在 8 种 Agent Harness 中完成 30 项智能体任务,Pi Agent 通过 20 项、成功率 66.7% 排第一,与最低的 OpenCode 相差 20 个百分点。
Qwen3.8-27B 正式开源,总参数量 270 亿,量化后 24GB 显存的 RTX 3090、4090 等消费级显卡有机会整卡装下。
DeepSeek Harness 发布后,GitHub 上带 dsh-plugin 标签的公开仓库已超过 700 个,社区围绕它做出了多 Agent 团队协作、跨会话长期记忆、侧边栏 IDE、@ 文件、外挂视觉模型等插件。
Kushal Chakrabarti 的论文 Why Does CLAUDE.md Keep Growing?
浙江大学团队开源 AI 科研智能体 Polaris,把文献调研、想法生成与评审、实验、论文写作与评审六个阶段串成一条流水线,研究者只在关键节点做决定。想法评审由多位立场各异的 AI 评审员正反辩论后按 Elo 排名,实验环节可连接实验室 GPU 服务器自动设计、编码、训练并逐项校验产物与指标,遇到取舍节点会暂停向研究者提问。
2026 年 7 月 Stack Overflow 全站提问量只有 1304 个,而 2014 年 3 月的单月峰值是 20.7 万个。开发者 Daniel Lockyer 把来自 Stack Exchange Data Explorer 的数据画成折线图发到 X,称这是「一个时代的终结」,Pieter Levels 转发后追问没有新内容后下一代模型拿什么训练。
机器之心梳理 Anthropic 近期争议,指出其内部文化裂缝与资本市场压力同时显现。匿名投资人与博主 Brian Roemmele 的转述称,公司投资者和员工士气低迷、对日渐封闭的高层不满,这些说法尚未得到 Anthropic 证实。
曾任理想智能驾驶负责人的郎咸朋与来自华为的任庚联合创办昆仑行,公司成立三个月内拿下数十亿人民币融资,选择全栈软硬一体的具身智能机器人路线。他称昆仑行走物理因果世界模型与数据编译的路径,让机器人学到的是物理规律而不是模仿动作,并认为今天的具身智能很像2015、2016年的自动驾驶,洗牌要等到真正量产交付、能够自我造血的时候。他还提到任庚定下的24个月进入行业前三目标,以及机器人进家庭大约需要5年。
Qwen-3.8 27B 可在 16GB 内存的电脑上断网本地运行,作者给出的 SWE-bench Pro 61.7、QwenSWE-Bench 79.0 两项编码基准超过 Opus 4.6 Max,Terminal Bench 73.0、NL2Repo-Bench 42.3 接近 Opus。
Brex 的 AI 工作流平台采用与运行时无关的编排模式,把编排逻辑写成只依赖类型化 Steps 接口的普通函数,生产环境用 Temporal 适配器、评估用进程内适配器,两端跑的是同一份编排代码。
北京时间 8 月 14 日,智谱发布 GLM-5.3,已向全部 GLM Coding Plan 用户开放,并可用于 ZCode、Claude Code、OpenCode 等 Coding Agent。
由 MATS program 研究员 Alexander Panfilov 领衔,马克斯·普朗克智能系统研究所、图宾根 ELLIS 研究所与 Snyk 联合发表的论文《Stealing Reasoning Traces from Proprietary LLM APIs》指出。
Uptime Labs 在 Incident Fest 研讨中指出,AI 自动化越多,人类专业知识在复杂故障中越关键。研究显示 AI 诊断准确时处置效率远超无协助状态,但建议错误时人类表现反而不如不用 AI。随着常规事故减少,工程师实操历练退化,企业需通过故障演练、混沌工程等方式维持人员技能。
IJCAI 2026 在德国不来梅召开,Agent、Multi-agent、Robotics、Reinforcement Learning 成为议程重点。阿里 Qwen-CUA 推进 Computer Use,Qwen DianJin 的 Fin-PRM 被大会接收;字节 Seed 的 GUI-ReWalk 探索大规模生成 GUI Agent 训练轨迹。
Waymo 联席 CEO Dmitri Dolgov 在 Y Combinator Startup School 演讲中回顾,团队约 12 人用 18 个月完成累计行驶 10 万英里、在 10 条约 100 英里路线上全程无人干预的 Demo,但此后约 10 年才推出无人驾驶服务,再用约 5 年扩大规模。
北京大学、东华大学与华南理工大学团队提出 UniMotion,将连续运动作为独立模态纳入统一多模态模型,在同一框架中连接 Motion、Text 与 RGB,论文已被 ECCV 2026 录用。该框架基于 Show-o2 1.5B,覆盖运动理解、生成、预测与编辑等七项任务,是对比方法中唯一覆盖全部任务方向的模型。
硅星人Pro 把 Kimi K3、Qwen3.8-Max、DeepSeek V4 Pro、Meta Muse Glimmer 和英伟达 Nemotron 3.5 Lightning 接进同一测试环境横评,K3 十项中六项满分居首,DeepSeek 排第二。
联想集团8月13日公布新一季度业绩,收入269.43亿美元、同比增长43%创单季度历史新高,经调整净利润首次突破10亿美元,AI相关收入同比增长60%,业绩发布后股价拉升20%。
机器之心解读了 DeepSeek Harness 背后的八十页论文《A Programming Paradigm for Spatiotemporal Composability》。
推荐理由:文章把八十页论文里的效应与余效应机制讲成运行时插件的卸载设计,便于理解自修改智能体如何干净回收组件。
Anthropic 发布第二份《风险报告》,共 186 页,披露了一款尚未向公众开放、能力略强于 Claude Mythos 5 的内部模型 Model 2,它已被大量用于编码、数据生成和其他智能体任务,并与 Mythos 5 并列公司内部使用最多的模型。
The Information 记者通过采访梳理了 Anthropic CEO Dario Amodei 妻子 Cami Clark 的经历,她没有任何正式头衔,却参与 Dario 的安保安排、公众形象、家庭投资和创业项目筛选。
Agent Memory Leaderboard 于8月12日发布首期成绩,商业产品榜 MemoraX 以58.0分居首,开源方法榜 InvMem、ReFind、ActiveMemoryIndex 以45.1、45.0、44.8分排前三。
章鱼动力将在世界机器人大会(WRC)首日发布全栈自研绳驱高自由度仿生灵巧手 OctoH-Hand,集成28个独立可控执行器、23个主动自由度和超1900个触觉传感单元,阵列间距≤1mm。
自变量机器人在8月12日的全网直播中完成一小时随机快递包裹分拣挑战,有效分拣1816件,综合成功率98%,约两秒一件。这套双臂机器人只配标准工业夹爪,未用灵巧手,速度比 Figure AI 公布的1248件/小时高45%,成本整体下降70%,搭载的是自研 WALL-B 具身智能大模型。合伙人兼算法一号位甘如饴在直播问答中表示,意图推理层面的泛化仍是长期目标。
澳大利亚昆士兰大学教授潘世瑞在 IJCAI 2026 有四篇论文入选,研究围绕图结构数据在标签缺失、分布偏移、隐私约束等真实缺陷下的学习方法。四篇工作分别为无监督图欺诈检测框架 CAMERA、联邦图级异常检测方法 FedCIGAR、事件感知的时间序列预测模型 EventTSF,以及用测试时计算扩展做蛋白质设计的 TTS-Design。
清华大学自动化系与腾讯混元提出 Listwise Policy Optimization(LPO),把 group-based RLVR 显式建模为 LLM Response Simplex 上的目标投影,并拆分为目标分布与投影方式两步。
智谱发布 GLM-5.3,base model 是一个 743B 的模型,未到 1T。在 Claude Code 相同任务下,GLM-5.3 优于 GLM-5.2 和 Opus4.8、弱于 Fable5,且在 max 模式下比 GLM-5.2 显著节省 token。横评各项 Benchmark 分数基本仅弱于 GPT-5.6-Sol 和 Fable5,作者期待后续真实任务测评。
DeepSeek 于 8 月 13 日发布首个 Harness 版本 DSH,以 MIT 协议在 GitHub 开源,核心口号是一切皆插件。
推荐理由:文章把 DSH 的插件化架构放进 Harness 范式尚未收敛的背景里,解释其开源策略为何是保留选择权而非交付成品。
MiniMax H3 团队于 8 月 7 日晚在 Reddit 的 r/StableDiffusion 社区举行 AMA,回应了 300 多条提问,确认用于最终 2K 输出的 H3-Regenerate-2K 模型会发布且不会太久,并计划近期提供一个无感知质量损失的 Sparse Attention 参考实现。
DeepSeek-V4-Pro-0813 上线不到 24 小时,官网便撤下正式版横幅和开放平台公告,开发者实测体验与官方跑分出现明显落差。顺着 Hugging Face 仓库提交记录可以看到,最初上传的配置与 V4-Flash-0731 完全一致,官方随后修正为 hidden_size=7168、384 个路由专家、61 层,并重新上传了部分权重分片。
WorkBuddy 完成第二次进化,以资料库为底座,将 Office 文档、HTML、Markdown 和 CSV 放进同一个工作空间,支持像批注 Word 一样直接批注修改 HTML,并用 CSV 表格替代数据库承担网页后端管理。团队协作单位从"一个人加一个 AI"扩展为"一群人与一群 Agent",项目资料与修改过程沉淀为 Agent 下一次工作的上下文。
DeepSeek 在 8 月 13 日晚发布 DeepSeek Harness v0.1 开发者预览版,采用 MIT 协议开源,用 npx @deepseek-ai/dsh web 即可在本地浏览器启动。
推荐理由:文章以一夜实测加插件生态盘点,对比 Claude Code 的封闭外壳路线,呈现 harness 被开源后的竞争变化。
DeepSeek 正式发布首款 Agent 产品 DeepSeek Harness,具备管理项目、长任务协作、多 Agent 编排、上下文管理以及联网搜索和 Skill 等本地 Agent 工作台能力。
北京邮电大学牵头,联合北京大学、清华大学、南京大学、明体科技和面壁智能提出 Physical AI 统一推理运行时 PhyAI,论文已发布在 arXiv。
小红书 dots 实验室宣布开源 dots3-note preview,它是 dots3 系列首个开源版本,总参数 280B、激活参数 16B,支持 512K 超长上下文窗口,具备文本、视觉与语音多模态理解能力,并针对复杂推理、Agent 和多模态感知做了优化。
华为鸿蒙 AI 基础软件技术专家丁天虹将在 2026 年 AICon 深圳站分享《从入鸿蒙到 AI Native:系统与 AI 融合下的应用智能化跃迁》,围绕系统智能体、端侧推理、可信安全和生态应用协同,结合 OpenHarmony Agent TSG 推进的三个生态实践展开。
求之科技世界模型负责人韩磊认为,具身智能行业对世界模型的定义之争只是话术,真正核心是模型有没有泛化能力。他负责的 S2 层世界模型通过隐空间像素轨迹预测和双目 3D 输入提升 OOD 泛化,公司自研仿真器 DISCOVERSE 2.0 基于 3DGS,可支撑上万 FPS 并发渲染。端侧现用英伟达 Orin,后续计划切换地平线征程 6。