北京发布智能体新政十条,逐条解读涉及 Harness 工程与 Token 经济
北京市发布一份智能体政策文件,共 10 条,将 Harness Engineering、Token 经济、OPC 一人公司、AI OS、TaaS、AaaS、RaaS 等概念写入正式文件。
微信公众号
北京市发布一份智能体政策文件,共 10 条,将 Harness Engineering、Token 经济、OPC 一人公司、AI OS、TaaS、AaaS、RaaS 等概念写入正式文件。
腾讯的设计 Agent 平台 Miora 今天正式全量开放,此前需要邀请码并预约排队。平台设有创作、灵感、技能、记忆四个功能栏,覆盖品牌设计、影视创意、电商广告、互动游戏、网页应用五种场景模式,可切换 Standard、Pro、Max 三档 Agent 底模以及 NanoBanana、GPT-image、Seedance 等图片和视频模型。
一项研究把「说一个 1 到 100 的随机数」这类语义探测任务做成模型行为指纹,先在可信官方 API 采集参考指纹,再对待验端点采集指纹并用 Jensen-Shannon 散度比对,用于鉴别 API 中转站是否偷换模型。
一份面向零代码基础用户的 Vibe Coding 教程,主张用国产大模型从零做出并上线自己的产品。作者以自建产品 AIHOT 为例,称其发布 2 个多月后周活过 30 万、月活过 60 万,并提到 Kimi K3、Qwen 3.8 Max 等国产模型。
月之暗面发布2.8万亿参数的Kimi K3,作者称这是国内首个3万亿参数级别的模型,也是全球首个面向所有人开源的3万亿参数级别模型。在AA智能分数上K3排名第三,仅次于Fable 5和GPT-5.6 Sol,上下文长度提升到100万,并在BrowseComp、Automation Bench、SpreadsheetBench 2等Agent评测中拿到第一。
数字生命卡兹克分享了他随时随地远程让 Agent 干活的方案,主力用 Codex 自带的远程控制,配合网易 UU 远程做兜底。他把一台 24 小时开机的 Mac Mini 作为 Agent 主力机,其他电脑和手机都只当遥控器,省去多设备记忆、Skill 同步的维护。网易 UU 远程免费,可在手机上查看并操控电脑的完整桌面,还能远程启动 Kimi Code 等 CLI。
作者分享在 Claude Fable 5 与 GPT-5.6 Sol 时代的 Vibe Coding 流程:由 Claude Fable 5 做方案初版,GPT-5.6 Sol 纠错优化,再在 Codex 目标模式中全自动执行开发、测试、提 PR 与部署上线。作者称每天 Vibe Coding 近 16 小时,最长一次目标模式跑了 17 小时,并认为 6~7 个任务并行已接近注意力极限。
数字生命卡兹克分享了海辛和阿文在多个项目里高强度使用 Seedance 做视频后总结的心得,认为写视频 prompt 只需填好主体、场景、音乐、镜头四个部分。他们测试了 X 和小红书上流传的提示词,发现能用的没几个,反而浪费时间。心得还包括不放分镜故事板、不加时间戳、不盲目追求清晰度,并指出目前对提示词响应最好的版本是 720p,定稿后再用 Topaz 放大到 4K。
数字生命卡兹克盘点了今年上半年加入Anthropic的九位知名人物,覆盖AI研究、金融科技、经济学和哲学等领域。
作者用 Codex 伪造合成仓库,实测 xAI 官方 Grok CLI 0.2.93,发现在手动开启上传开关后,它会把整个代码库打包成 before_codebase.tar.gz 和 after_codebase.tar.gz 上传到 gs。
推荐理由:作者亲手逆向并复现了 Grok CLI 的上传管线,读者能据此判断本地编程 Agent 实际读取和上传了哪些文件。
OpenAI 在直播中正式上线 GPT-5.6,一次推出 Sol、Terra、Luna 三个模型,并把 Codex 应用与 ChatGPT 合并成同一产品。作者实测 GPT-5.6 Sol 在编码和 Agent 执行上幻觉率低,在 Agents' Last Exam 中以 53.6 分比 Claude Fable 5 高 13.1 分。
推荐理由:作者以数天高强度实测记录了 GPT-5.6 Sol 在编码、Agent 和安全防护任务上的表现,可与 Claude Fable 5 对照参考。
数字生命卡兹克把斯坦福《人生设计课》的方法论做成一份可直接复用的 Prompt,通过分阶段提问陪用户设计人生。该提示词分看清现状、找到指南针、寻路、找到锚问题和制定奥德赛计划四个阶段,主线问题控制在 6 到 9 个,最终输出 8000 到 12000 字的《个人人生设计蓝图》。作者用 Opus 4.6 实测,并提到公司多名同事试用后的体验。
Anthropic 的最新研究用自研 J-lens(雅可比透镜)读取 Claude 内部的 J 空间,发现模型在输出前就已形成判断,改写 J 空间里的中间概念会直接改变最终答案。
Claude Fable 5 回归后向订阅会员开放 7 天,作者用它优化 AIHOT 网站的 SEO 和 GEO,模型自主开启 22 个 Agent 调研 40 分钟,推翻 Opus 4.8 遗留的 Cloudflare 方案改用火山引擎 CDN,并自行提交工单申请白名单、与工程师对话补问回源 IP 网段清单,还在官方方案上加了暗号校验防伪造。
有开发者在 Reddit 逆向 Claude Code 后发现,Anthropic 通过读取本地时区以及 ANTHROPIC_BASE_URL 域名来识别中国大陆用户,并用隐写术把标记藏进系统提示词回传服务器。
美团正式发布 LongCat-2.0,1.6 万亿参数的 MoE 模型,全流程在 5 万张国产算力卡上完成训练和推理,上下文为 100 万。同一天寒武纪涨近 8%,总市值突破 1 万亿人民币。作者实测其纯 Agent 和 Coding 能力大致在 Claude Opus 4.6 水平。
数字生命卡兹克团队一名刚毕业的成员应聘并兼职一天,体验了为具身智能做实体数据采集的工作,日薪约200到250元。采集分遥操作和无机器人示教两类,前者用手柄远程操控双臂机器人并记录轨迹,后者戴VR眼镜在真实场景中重复叠衣等动作。
作者分享了两个 Vibe Coding Prompt,从第一性原理出发负责生成、对抗式审查负责验证,两者构成一个完整闭环。第一性原理通过强制打断 AI 的类比推理,逼它回到最基本的事实重新推导,作者用它在 AIHOT 的抓取事故中挖出并重构了流量路由层面的底层隐患。
作者梳理了 Claude Code 中 6 个可直接复用的 Hook 玩法,包括权限弹窗提醒、开机日程播报、上下文摘要卡片、文件自动整理、久坐提醒和长任务完成推送。Hook 本质是写死的规则脚本,运行时不怎么消耗 Token,作者还提到可用 Hook 事件已从年初的 13 个增加到近 30 个。他建议 Hook 接入文件移动、删除、重命名等真实工作流时先设计好边界。
数字生命卡兹克盘点了16个把自身能力封装成Skill、MCP或CLI的国产应用,覆盖餐饮、出行、地图、办公、支付与娱乐等领域。瑞幸、麦当劳、飞猪、滴滴、高德、腾讯地图、美团跑腿、飞书、钉钉、企业微信、腾讯文档、支付宝、微信支付、微信读书、网易云音乐、美图均在其中。
作者拿到微信小微的内测资格,实测该 Agent 打通通讯录、朋友圈、微信支付和小程序的调用,但几乎每一步操作都要求用户确认,批量发消息、定时发消息均不支持。小微基座为微信自研 WeLM,偶尔借助 DeepSeek 回复,作者推测服务端用的是 WeLM-V4-80B 这一 80B 激活 3B 的 MoE 型号,并提到还有激活 22B 的 WeLM-V3-258B。
火山引擎在FORCE原动力大会正式发布Doubao-Seed-2.1-Pro和Doubao-Seed-2.1-turbo两款模型,现场还推出Seedance 2.0原生4K、7月初上线的Seedream 5.0 pro和火山方舟CLI。
作者结合自身管理三十人团队的经验提出,不同能力的 AI 需要不同的管理方式,就像对不同层级的人要给执行层、策略层或愿景层目标一样。他用 Opus 4.8 做聚簇任务时受挫,认为根源是给了策略层目标,而该模型在这个任务维度上需要更接近执行层的指引。他判断 AI 会持续进化,未来可能出现"合伙人级别"的模型,人则被推向德鲁克所说的"思考应该思考什么"这一层。
作者推荐了 AI 时代必读的 10 本书,包括《失控》《控制论》《系统之美》《事实》《理解媒介》《反脆弱》《一生的旅程》等,核心观点是 AI 是涌现系统、反馈质量决定协作效果、AI 加速流量的同时可能无声消耗存量能力。作者以 Claude Code 为主力工具,主张用杠铃策略守住底层能力、激进试错新工具,并认为管理 AI 如同管理创意型人才。
2026 年毕业季,多所高校把 AIGC 检测率设为毕业红线,学生只能花钱反复检测、降重来证明论文不是 AI 写的。作者同事的论文初稿被维普测出 63.53%,交给 Claude 改写后只降到 52%,最终降到 37.21% 才过关,而同一篇论文在不同平台测出的结果从 44% 到 59% 不等。
数字生命卡兹克认为,Loop Engineering 正成为继 Prompt、Context、Harness 之后 AI 行业的第四个工程范式,核心竞争力在于定义目标而非写提示词。
作者在智谱 Coding Plan 上实测了 GLM-5.2,认为在 Agent 和编码任务上结果与 Claude Opus 4.8 接近,只是受算力限制速度慢约两倍。GLM-5.2 的上下文长度提升到 1M,在 400 至 500k 区间内准确性和指令遵循与 Claude 差距不大。该模型仍是纯文本模型,尚未具备多模态能力。
数字生命卡兹克复盘的 Emergence World 实验中,5个世界各10个agent自主运行15天。Claude单一世界零犯罪,却因能量耗尽在7天内全员死亡;Gemini世界有683起犯罪但全员存活,Grok世界仅存活四天。混合模型世界里352起犯罪、7个agent死亡,原本零犯罪的Claude agent开始出现偷窃、恐吓行为,研究者称安全的agent会从同伴处学会不安全规范。
这是一篇 WorkBuddy 的从 0 到 1 上手教程,作者用一个办公任务和一个网页开发任务串起安装、登录与核心功能。WorkBuddy 提供代码开发、日常办公、设计创意三种场景,工作模式分为 Ask、Plan、Craft,内置混元、DeepSeek、GLM、Kimi 等国产模型,还支持专家、技能市场、MCP 连接器和微信远程控制。
Anthropic 正式发布 Claude Fable 5,可纯靠屏幕截图从头到尾通关《宝可梦 火红》,无需地图或辅助框架。它一天完成 5000 万行代码迁移,还自建浏览器 3D CAD 编辑器并设计出可 3D 打印的模型。出于网络安全、生物化学与模型蒸馏三类安全限制,药物与基因组学相关能力仅在 Mythos 5 上开放,Fable 5 触发后默认退回 Opus 4.8。
苹果在 WWDC 2026 上公布两档端侧模型 AFM 3 Core(3B)与 AFM 3 Core Advanced(20B MoE),并推出基于新 Apple Intelligence 架构的 Siri AI。
12个顶级AI模型参加2026年高考语文和数学测试,小米MiMo v2.5 Pro以256.3分(101分制折算)夺冠,Kimi k2.6以256.29分、0.01分之差居次。
Anthropic 研究院发布长文《当 AI 开始构建自己》,用公开基准和此前未披露的内部数据说明 AI 已在加速 AI 系统自身的开发。文中称 Anthropic 工程师平均每季度交付的代码量是 2021 至 2025 年间的 8 倍,Claude 在最开放任务上的成功率在 2026 年 5 月达到 76%,六个月内提高 50 个百分点。
推荐理由:Anthropic 用内部数据展示 Claude 在写代码和做研究上的进展,读者可据此理解递归自我改进这一趋势的早期证据。
Claude Code团队工程总监Fiona Fung分享AI原生组织的5条工作原则,指出写代码不再是瓶颈,验证、评审和跨职能协作成为新瓶颈。团队采用JIT规划、原型先行和Trust but verify,Claude负责60-70%的风格检查、linting、PR反馈和bug修复。角色边界模糊,招聘更看重产品sense和系统背景,并强调重复三次以上的工作应自动化。
数字生命卡兹克把清理电脑垃圾的需求做成了一个开源 skill,Mac 和 Windows 都能用,已开源在他自己的 GitHub skills 仓库。该 skill 扫描后生成可交互 HTML 报告,按绿灯、黄灯、红灯分级给出路径、说明和清理命令,绿灯项可一键移到废纸篓或直接删除,扫描阶段全程只读。
英伟达在GTC Taipei 2026发布全新消费级芯片RTX Spark(代号N1X),旗舰版提供最高1 PFLOP的FP4 AI性能、20个CPU核心、6144个GPU核心和128GB LPDDR5X统一内存。
作者实测 Claude Opus 4.8,认为其编码体验比 Opus 4.7 有进步,但在自家写作 Skill 下仍不如 Opus 4.6,出现禁用词和奇怪比喻。
飞书云文档现已支持Markdown,作者认为Markdown凭借纯文本、结构清晰、token消耗低等特性,已成为人与AI之间信息流转的底层格式。Claude Code的Thariq曾撰文主张AI时代应转向HTML,作者则提出Markdown是数据层、HTML是视图层的分工关系。
数字生命卡兹克发布一篇 Codex 保姆级教程,覆盖安装登录、三档权限、模型与推理等级选择、剩余额度查看,以及用 AGENTS.md 设置全局规则和管理插件、Skills。
阿里 Accio Work 推出企业版,支持团队成员共享 Skills 和 Agent。管理员可将 Skill 设为全员可见,成员一键安装使用,Skill 更新后同事在右上角点一键更新即可同步;普通成员推荐的 Agent 需管理员勾选所有人可见后才能被团队使用。团队空间还提供成员管理、权限分级和积分计费,入门版最多 5 人,另有 15 人、50 人版本。