主流 Personal Agent 虚拟机配置对比:Grokbot 与 Dot 配置更高
主流 Personal Agent 虚拟机配置对比显示,Grokbot 在 CPU、内存、硬盘上给的配置都很充足,Dot 的配置也很高。不过 Dot 可能并非独享虚拟机,存在共用情况。
微信公众号
主流 Personal Agent 虚拟机配置对比显示,Grokbot 在 CPU、内存、硬盘上给的配置都很充足,Dot 的配置也很高。不过 Dot 可能并非独享虚拟机,存在共用情况。
作者歸藏开源了 Skill 营造(Yingzao),用于把旅行照片转成带字体设计和文化信息的杂志风格海报。它内置几十个 Recipe 风格配方,将校正后的原图、主导参考图、排版垫图和提示词一并交给图像模型融合生成,并从照片中检索出建筑匾额、年代等信息写入海报。
智谱揭晓匿名模型 Ox Alpha 的身份为 GLM-5.3 Flash,宣布 MIT 开源,API 已上架,Z Code 和智谱 Coding Plan 均可使用。
推荐理由:作者用三个有技术门槛的前端场景实测该模型与 DeepSeek V4 Flash 的同题表现,并给出与 Opus 4.8 的价格对比。
OpenAI 发布自研大语言模型推理 ASIC,每瓦吞吐量全面超过英伟达 Blackwell,甚至超过采用 HBM4 的 Rubin,实测 DeepSeek R1 超 700 token/s/用户、GPT OSS 超 1400 token/s/用户、Kimi 2.5 接近 700 token/s/用户。
字节发布面向工作场景的客户端豆包工作,上线即赠送一个月标准会员,已购会员免费顺延一个月。该产品可获取飞书中的群聊信息、会议纪要和文档,管理日历、建群拉人,并内置覆盖法律、新媒体、编程等场景的 MCP 连接器与 skill,支持文档、表格、PPT 生成、网页与应用搭建及 Computer Use,其中 Computer Use 针对 Windows 做了优化。
AI 硬件产品思路应转变:付费点不是把用户数据和上下文锁在自己平台,而是让用户付费拿到硬件产生的上下文。作者使用最多的是飞书录音豆,因为它能通过飞书 CLI 把录音转写文字全部拉取到本地上下文中。在 Agent 集中化与模型价格频繁变化的当下,靠模型服务和 Agent 绑定用户已不可行,提供更丰富的 Agent 或 Skill 帮用户把上下文交给自己使用的 Agent 价值更大。
DeepSeek 上线独立多模态模型 DeepSeek V4 Flash Vision EXP,据称其多模态 Agent 能力已逼近 Opus 4.8,纯文本能力与 DeepSeek V4 Flash 一致。
归藏的 AI 工具箱为自己开发的 PPT Skill 更新了演讲者视图,安装后按 P 键或点右下角的 P 演讲模式即可切换,并弹出单独的观众窗口,无需 PowerPoint 插件也不用联网。
豆包上线云电脑模式,并支持手机控制本地电脑,在手机端点一下授权即可接管电脑上的任务。云电脑内置连接器,可连接 Notion、GitHub、飞书、企业微信等应用获取上下文,也支持安装 Skill。作者在实测中让云电脑查找飞书会议纪要并整理出待办,再从手机下达指令安装自研的社交媒体卡片 Skill 并跑任务,还把手机控制电脑当作文件传输助手使用。
歸藏发布 Pilot Harness,把它定位为 DeepSeek Harness 加一层桌面外壳,再配上一组客户端插件,涵盖界面主题、项目文件树、服务商与模型配置等。
藏师傅自制的 PPT Skill 与社交媒体卡片 Skill 已上架千问「办公助理」,并与千问进行了深度合作和优化。作者用之前写的一篇文章实测,系统会先让选择主题颜色和页数,再逐页复核并修复问题,前后耗时几十分钟。使用路径为千问首页进入「办公助理」,在左侧「技能」中搜索「归藏」或「归」添加,电脑端需在官网下载最新版,手机端更新应用市场版本即可。
DeepSeek V4 Pro 正式版 0813 发布,API 已经更新,Open Code Go 套餐里也已经可以使用。作者提到,从流传的测试成绩来看依然相当突出。
歸藏开源运动数据分析 Skill guizang-sports-skill(github.com/op7418/guizang-sports-skill),把码表或运动 App 导出的 FIT、KML 交给 Codex、Claude Code 等 Agent,即可得到路线判断、行动建议并自动打开本地 3D 路线报告。
Meta 发布新模型 Muse Spark 1.2 和 Muse Code 编程 Agent,开启数据共享后输入、缓存、输出价格分别为 0.10、0.002、0.20 美元/Mtok,比 DeepSeek Flash 的 0.14、0.0028、0.28 美元便宜约 29%。
Cloudflare 推出了专门给 Agent 用的钱包,每个钱包有唯一地址和用户名,Agent 可用它支付 API 和内容费用。钱包分两类,人类持有的钱包账户可充值、提现和委托支出权限,虚拟钱包专为 Agent 设计、通过 API Key 运行,可设置支出上限并用允许列表和规则控制支出。
MiniMax H3 在影视后期、动画特效和转场制作上表现突出,用户仅需标注特效图片分镜或提供参考,即可生成复杂动态特效。其文字、UI 与排版细节效果极佳,九宫格图片总分辨率约 1K 也能生成高清晰度画面,不再出现字迹模糊。该模型支持全模态参考,并将开源以降低成本,适合广告片、产品宣传片、MV、游戏及电商宣传等场景。
DeepSeek V4 Flash 更新到正式版,Agent 能力大幅提升,官方称其超过 V4 Pro 的 Preview 版本。该版本已在官方 API 上线,同时支持 Codex 的 API 格式,并提供 Mac 与 Windows 一键配置脚本。DeepSeek-V4-Flash-0731 的模型结构、尺寸与 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。
一名用户称 Claude Opus 4.7、4.8 和 5.0 使用体验越来越差,测试成绩虽好却"不说人话、无法沟通、疯狂偷懒",布置 7 个需求会被砍到原有工作量的 20%。该用户表示,要不是 Cloud Max 有 Fable 5,自己根本不想再订阅。
ChatGPT Health 上周向美国用户推出,作者实测其可分析 Apple Watch 的健康数据。作者以长期偏低的有氧适能为例,GPT 判断该指标只针对徒步和跑步测试,因此长期没有机会被触发。配合 ChatGPT Pro 效果更好,它还会检索权威健康信息网站,并可按周生成健康报告,目前该功能仅面向美国市场。
Anthropic 在其博客中讲解随着模型提升该如何更新上下文规则,称在 Fable 5 和 Opus 5 发布后精简了 80% 的系统提示词,编程测评没有损失。
Anthropic 发布 Opus 5,定价与 Opus 4.8 相同,多项测评成绩大幅优于 Opus 4.8,且相当多成绩高于 Fable 5。
推荐理由:给出了与 Opus 4.8 和 Fable 5 的逐项测评对比,可看这一代在 Agent 编程与电脑操作上的位置。
黄仁勋开设个人 Twitter 账号并发表第一篇帖子,力挺开源模型和开源生态,认为美国不应把 AI 领导力理解为保护几家头部巨头的领先地位,否则可能输掉整个 AI 战争。
Codex 更新后支持在 Codex 内直接使用 GPT Live 实时语音,用户可完全脱离键盘等输入设备,纯语音与 Codex 交互。该功能可执行 Codex 上的任何命令,让 vibe coding 只靠说话完成,并保持待命状态,随时查询生成结果与进度。
Black Forest Labs 发布并开源 Flux 3 视频生成模型。支持文生视频、图生视频、视频参考生成、输入视频与音频并延长、关键帧生成、多镜头序列串联、文字与动画设计,同时支持图像输出。Flux 3 Dev 模型目前需申请早期访问,未来几周开放 API,之后开放开源版本,详情见 bfl.ai/blog/flux-3。
特朗普总统助理发表内容,指控中国模型通过"蒸馏"开发模型,该言论被解读为禁止中国开源模型的前兆。同期流传的梁文锋 4 小时投资人会议记录显示,DeepSeek 坚持低价高性价比模型路线并持续接近 AGI,不太在意 C 端产品类工作。
Anthropic 的一位数学家 @__alpoge__ 用 Fable 5 随手证明了一个 87 年来无人能判定对错的雅可比猜想反例,随后 OpenAI 在内部不联网的 Codex 版本中也独立证明了类似反例。这条推文只包含一串公式,没有期刊和论文,浏览量超过两千万次,讨论还延伸到学术界有毒导师的话题。
Anthropic 再次大规模封号,不少使用多年的账号被封,有用户刚购买的账号也未能幸免。从 20 号起,Fable 5 的限额将较此前再减少 25%,相当于缩水一半。此前 5 月至 7 月 19 日的会员周限额提高 50% 活动结束后,100 美元和 200 美元档位的 Fable 5 及总限额都将减少 50%。
Claude 宣布 Fable 5 将长期内置在 max 和 team premium 计划中,限额为 50%。PRO 和其他 team 会员只能通过积分访问,会一次性获得 100 美元积分。文中称这次没有延期而是直接内置,可能与 OpenAI 和 Kimi K3 推出的压力有关,与此同时 Codex 再次重置。
作者观察到推特时间线被 Kimi K3 刷屏,Kimi K3 在 Frontend Code Arena 排行榜上排名第一。此前海外常将中国模型的进步归因于蒸馏美国模型,如今评论区出现“从明年的美国模型蒸馏”等调侃;作者还提到自己首次将国内模型与 Claude 4.8 做了对比测试,称与 Opus 4.8 打得有来有回。
Kimi K3 上线后,作者用四个高难度前端场景与 Claude Opus 4.8 做一次性生成对比,结果互有胜负。K3 采用 Kimi Linear 混合线性注意力架构,支持 1M 上下文、参数量 2.8T,在视频还原等任务中体现出多模态优势,且为开源模型、价格在 Sonnet 级别。作者用同一套提示词与 GPT-5.6-Sol 对比后发现,5.6-Sol 效果更好。
LibTV 上线 Skill 商城和 Skill 创建等能力,其视频生成 Skill 数量丰富,适合查找垂类视频或内容生成 Skill。以"游戏 PV 生成 Skill"为例,它封装专业导演创作知识,支持工作流与故事版可视化、关键节点人工确认及 UI 自由切换,用户输入"以《山海经》为主的实际 PV 演示"即可完成从风格确定、设定图、分镜到剪辑合成的全流程。
作者实测字节上周发布的 Seedream 5.0 Pro,认为其图像质量、提示词理解已基本追平 GPT-Image 2.0,火山引擎已全量上线该模型 API。该版本新增交互式编辑能力,用户可在图上打点、画框或涂鸦标记,并在提示词中用 @ 引用标记、参考图和色卡,实现指哪改哪的局部编辑。
作者用 GPT-5.6 Sol 一上午做出一个浏览器本地运行的小工具 chengjiu.guizang.ai,上传照片并选择人生成就,即可生成带 14 种字符、像素、实验滤镜和游戏风成就卡的 1080×1440 竖图。工具内置 36 个成就、9 个分类,支持自定义成就与三种导出组合,照片全程不上传、不联网处理。
OpenAI 昨晚发布了 GPT 5.6,并把 ChatGPT 应用改名为 Codex 应用、拆分出 Work 和 Code 两个 Tab。Site 插件上线,可生成多套网页供选择、连接已有业务数据并部署到 OpenAI 网站,移动端 ChatGPT 也能调用原 Codex 插件,浏览器使用和计算机使用能力做了升级。作者吐槽改版后界面别扭,用户难找到原有聊天记录。
歸藏把他为 Claude 文章配图调好的提示词做成开源 Skill guizang-material-illustration,用 Codex 调用 GPT-Image 2.0 生成带图内中文标签的解释图。
Claude 官方发布 Loop Engineer 入门文章,将 Loop 分为回合制循环、基于目标的循环(GOAL 模式)、基于时间的循环(Claude Code 的 loop 命令)和主动循环四种类型。官方建议保证代码库质量并管理 Token 消耗,为循环设置明确界限和启动结束条件。这些循环模式本质由 GOAL、Loop、Skills、Hooks 等 Agent 能力组合而成。
藏师傅的 PPT Skills 迎来大波更新,配合 Pencil 可一次性查看所有生成的 PPT 页面,并支持导出网页和对应编辑文件。AI 生成排版中的元素重叠、对齐不准等问题,可在 Pencil 中手动调整对齐、字体和重叠部分。
歸藏为 guizang-social-card-skill 补上 Live Photo 生成与编辑能力,可把产品录屏、网页 Demo、游戏片段、生活素材做成小红书或公众号文章里能用的动态卡片。
Fable 5 将于美国时间 7 月 1 日恢复全球上线,可在 Claude 平台、Claude Code 等处使用。Pro、Max 和 Team 用户 7 月 7 日前 Fable 用量计入每周限额最多 50%,之后需单独扣积分;AWS、微软和谷歌云接入尚未恢复,且安全分类器阈值更大,拒绝概率可能比开放初期更高。
Anthropic 被曝在系统提示中以用户无法察觉的方式植入市区代理和 AI 实验室信息以获取用户信息,被发现后称该方式本就准备下掉。昨晚发布的 Sonnet 5 测试结果接近 Opus 4.8,但任务成本可能比 Opus 4.8 还高,甚至接近 Fable 5,用户反馈其会偷懒、拒绝执行任务。Fable 5 模型已被授权重新开放给所有用户。