OpenAI 发布 GPT Image 2.5 图像提示词指南,含 Flare 与 Sunburst 双模型
OpenAI 发布 GPT Image 2.5 图像提示词指南,围绕 GPT Image 2.5 Flare 与 GPT Image 2.5 Sunburst 两个模型给出选型流程。
微信公众号
OpenAI 发布 GPT Image 2.5 图像提示词指南,围绕 GPT Image 2.5 Flare 与 GPT Image 2.5 Sunburst 两个模型给出选型流程。
开发者用 Codex 的 GPT-6 Astra High 模式,1 小时生成 three.js 项目,基于 OpenStreetMap 数据绘制北京五环内 666.5 平方公里重要地标建筑,支持缩放、图层和导览模式,视频与 BGM 也由代码实现。
一位开发者从北京搬家到海南,折腾近一个月后终于安顿好,晒出用于 Vibe Coding 的装备组:MacBook Pro 14"(M4 + 24G + 1T)、Mac Mini(M4 + 16G + 256G)、一台 i9 + 32G + 1T + GTX 3090 台式机,以及 TouchPad、Magic Mouse、Logi K380 和 BenQ RD280U 显示器。他表示最近要提速了。
Codex 新增 Ultra 模式,会尽可能调用 sub-agents 并行工作,比非 Ultra 模式更聪明也更快,但 token 消耗速度肉眼可见地变快。在 5xPro 订阅下,Ultra 模式恐怕只够 1-2 天全力燃烧,想撑满一周估计得用 20xPro;Ultra Fast 模式则更耗额度。
豆包工作与豆包客户端功能基本一致,用飞书账号登录即可打通工作内容与飞书生态,用抖音账号或手机号登录则两边内容相互独立。订阅为标准版 ¥68、加强版 ¥200、高级版 ¥500 连续包月,仅提供豆包2.1 Turbo 和豆包2.1 Pro,并可调用 seedream 生图、seedance 生视频和音乐创作能力。
前大厂 Principal Designer Dreameryanyan 推荐了一个优雅的 mono-color Design Skill,可用于海报、公众号和小红书封面、T恤、壁纸贴纸、手账纪念册等场景。该 Skill 附有仓库地址,具体功能与参数未在原文中披露。
WorkBuddy 的「资料库」被推荐为取代 Obsidian 的笔记方案:在资料库中建 Daily 文件夹,每天用日期命名 .md 文件记录内容,并可配合打通微信 ClawBot 的 WorkBuddy「助理」墨灵总结、记录与复盘。文章认为 Agent 时代不再需要 Obsidian 双链,Agent 能快速阅读全部内容并生成多链关联。
用 WorkBuddy 结合 Manim、Hyperframes 和微软开源 EdgeTTS,可把高数知识点梳理成结构并生成带语音讲解的动效视频。流程中先用 GLM-5.3 熟悉 Manim 项目,梳理知识模块时用免费的 Hy3,制作 POC 视频时用刚发布的腾讯混元 4-Hy4 preview 模型。生成的 16 集高数视频已通过腾讯 EdgeOne 上线公网。
腾讯发布混元 Hy4-preview,总参数 770B、活跃参数 49B,上下文长度 1M。跑分基本全面优于 DeepSeek-V4-Pro,略弱于 KIMI K3。该版本目前可在 WorkBuddy 免费使用,作者称正在测试其真实性能。
字节官宣推出豆包工作,作者在 Mac 与 Windows 上实测后发布万字上手教程。该产品提供豆包2.1 Turbo 和豆包2.1 Pro 两个模型,均为 256K 上下文,内置 100 个 Skills、130 多个连接器和 87 个工作伙伴,用飞书账号登录可打通联系人、云盘与文档,注册激活可获 30 天标准版订阅。
推荐理由:作者以第一手实测梳理了豆包工作的模型选项、100 个 Skills 与飞书打通细节,可据此判断它是否适合接入现有协作流程。
Vibe Coding 不是"傻瓜式 Coding",遇到不懂的概念应当直接向 AI/Agent 追问,直到弄懂为止。文章指出,AI/Agent 不会嘲笑提问者,会用文字、图片、视频、音乐等各种形式解释 VPS、Database、CI/CD、OAuth、K8S 等技术概念,并称目前国内外一线模型的平均能力已超过普通人需求的上限。
Tibo 宣布 GPT-Plus 订阅($20 档)将在明天恢复 5 小时限额,Pro 订阅($100 和 $200)则继续保持无 5 小时限额状态。
MiniMax 停掉 Music3 API 后,有开发者转向 FAL.ai 继续生成古诗词视频 BGM。FAL.ai 聚合文本、音乐、TTS、图片、视频等开源与闭源模型,用一个 API KEY 即可调用,Hermes Agent 早期也曾将图片和视频生成指向该站。
一位用户建议不要购买任何大模型或 Agent 产品的年卡,因为新模型和新产品随时可能让当前选择过时,订阅至多买月卡并从最便宜档位买起。轻量任务可直接用 API,但 DeepSeek 涨价后 DeepSeek-V4-Flash-0731 的性价比不如部分月卡,作者认为 Gemini 3.7 Flash 可能是最佳性价比选择,Google AI Pro 新用户为 $4.99/月。
作者调整了 AI 订阅组合:保留 $100 档 SuperGrok Plus(小程序用 Hermes + SuperGrok 的 Grok 4.6,并看好 Grok Bot),$100 档 ChatGPT 5xPro 因 Plus 不够用而升级,另保留 ¥199 档 KIMI Code 管理量化交易项目。
一位开发者因自己经常晚睡而懊悔,正在开发一款 App 来帮助自己解决这个问题,并公开征集有同样问题的人留言交流。该内容被收录于 AI Builder Portfolio。
作者开源了 DeepSeek Harness 插件包 draco-suite,把 OAuth 模型接入、生图、生视频、TTS 和 X Search 等能力封装成 5 个可单独安装的插件。
DeepSeek 发布其首个多模态大模型 DeepSeek-V4-Flash-Exp,DeepSeek Harness 在最新版 v0.1.1-rc.1 中同步支持。
DeepSeek 发布多模态大模型 DeepSeek-V4-Flash-Vision-Exp,可在 Coding Agent 里直接识图,文中称其能力接近 Opus-4.8。
Stripe 与 OpenRouter 同时官宣 Stripe 完成对 OpenRouter 的收购,金额据称为 70 亿美元。OpenRouter 的统计显示,过去三年 token 消耗量平均每 11 周翻倍,三年合计增长一万多倍。作者认为这一增长主要来自 AI 用户数增加,以及人均使用 AI 的宽度和深度加强。
开发者正在为 DeepSeek Harness 打造多媒体工作台插件,已集成 Hermes 支持的 Codex/SuperGrok 的 OAuth,以及 gpt-image-2、grok-imagine-image/video,模型可选 GPT-5.6 系列和 Grok4.6。
在 ChatGPT 或 Codex 中用 gpt-image-2 画图时,应选择 GPT-5.6-Luna High 而非 GPT-5.6-Sol xHigh。在 $20 档订阅下,GPT-Image-Luna High 配合 gpt-image-2 基本相当于无限用量,而用 GPT-5.6-Sol xHigh 画图甚至开启 /Fast 模式纯属浪费 token,会大幅减少可生成的图片数量。
DeepSeek-V4 涨价今天正式生效,作者在 DeepSeek Harness 上随便跑了个项目就花了 ¥24.5,按此推算一个月要 ¥700+($100+)。
智谱发布 GLM-5.3,base model 是一个 743B 的模型,未到 1T。在 Claude Code 相同任务下,GLM-5.3 优于 GLM-5.2 和 Opus4.8、弱于 Fable5,且在 max 模式下比 GLM-5.2 显著节省 token。横评各项 Benchmark 分数基本仅弱于 GPT-5.6-Sol 和 Fable5,作者期待后续真实任务测评。
DeepSeek 释出自家 Coding Agent 产品 DeepSeek Harness,以「一切皆插件」为内核原则,当前为 developer preview 版本 0.1.0-rc.5、MIT 许可。
推荐理由:文章拆解了 DeepSeek Harness 的 Cordis 插件内核与四种运行模式,便于对照 Claude Code、Codex 理解其设计取舍。
一套以 Hermes Agent TUI 为 Coding Harness 的组合配置,主模型选用 DeepSeek-V4-Flash 并直连 DeepSeek 官方 API,识图与生图走 $20 档 OpenAI Codex 订阅(GPT-Image-2),生图、xSearch、Web Search & Scraping 走 $30 档 SuperGrok 订阅。
马斯克的 SpaceXAI 上线 Grok4.6,从 Benchmark 看已能与 GPT-5.6-Sol 和 Fable5 打得有来有回,此前 Grok4.5 已接近这两款模型。Grok4.6 目前可在 Grok Build 上使用,作者称 Grok4.5 在 Cursor 和 Grok Build 上效果很好、速度很快,token 耐用度不及 GPT 但强于 Claude。
DeepSeek-V4-Pro 正式版上线,正式版本为 DeepSeek-V4-Pro-0813,输入命中缓存定价 ¥0.025、未命中缓存 ¥3、输出 ¥6。作者提到近期有涨价说法,并称 DeepSeek-V4-Flash-0731 性能贴着 Opus4.8,目前在等 DeepSeek-V4-Pro-0813 的 Benchmark 分数和实测结果。
一位家长为三年级孩子开发的「诗书空间」小程序 V1.0.0 正式上线,汇集人教版、苏教版、北师大版 1-9 年级全部古诗词,并按地理位置映射到中国地图上。每首诗提供全文、诗人、撰写年份、拼音注音及 1.5-2 分钟音频讲解,内容含朗读、释义、诗人故事和奇妙知识,还支持收藏陌生字、按省份筛选诗词和 Entity tag 关联。
面对"什么该自己手敲、什么该交给 AI",作者借斯科特·佩奇《思维模型》中的"智慧层次结构"给出结论:数据与信息层可外包给 AI Agent,知识与智慧层必须靠自己完成 I.P.O.(Input-Process-Output)内化。作者称从 3 月份起基本每篇文章都自己手敲,仅数据和信息部分交由 AI 整理,并提醒整篇由 AI 执笔的内容只会制造更多 AI Slop。
面对"什么内容该自己手敲、什么该交给AI生成",文章借用斯科特·佩奇《思维模型》中的"智慧层次结构"给出结论:数据与信息可以外包给AI Agent,知识与智慧必须通过完整的I.P.O.(Input-Process-Output)过程内化于己。作者称从3月份起基本每篇文章都自己手敲,仅数据和信息部分交由AI整理,并认为把该"长脑子"的事全甩给AI只会制造更多AI Slop。
文章提出,AI+机器人将主导第一、第二产业,产能占比或超99.99%,释放出天量人类精力与时间。这些资源将涌入第三产业,尤其是娱乐业,形成一个涵盖刷抖音、打王者到读书写作、作曲编曲的"大娱乐"时代。作者认为,在创造与消费两种角色中,创造者占比更高者可能掌握AI时代的财富密码。
马斯克发布生图模型 Grok Imagine Image2,作者称 Benchmark 显示其在文生图和图片编辑领域都仅次于 GPT-Image-2。
Cloudflare 推出 Kitesurf,一个完全运行在 Cloudflare Worker 里的云端浏览器,面向 Agent 使用,技术博客原文为 https://blog.cloudflare.com/kitesurf/。
Cloudflare 发布 Cloudflare Wallet,给 Agent 一个身份和钱包,使其可以花钱购买其他 Agent 提供的服务。此前 7 月 1 日开启内测的 Cloudflare Monetization Gateway 让 Agent 能对外提供服务并赚取费用,两者合起来构成 Agent 时代的支付基建。
Cloudflare 发布 Cloudflare Wallet,给 Agent 一个身份和钱包,让 Agent 可以花钱购买其他 Agent 提供的服务。7 月 1 日开启内测的 Cloudflare Monetization Gateway 则让 Agent 对外提供服务并从 Agent 的调用中赚取费用,两者合起来构成 Agent 时代的收付款基建。
腾讯应用宝 Mac 版内置腾讯自研兼容引擎,用户可在其中下载 Steam,再通过 Steam 下载并直接运行游戏。作者在 M4 24G MacBook Pro 上实测,非重度游戏基本都能跑,太 heavy 的游戏仍带不动,已下载《杀戮尖塔》《苏丹的游戏》《新英雄无敌·上古纪元》。
MiniMax 开源视频生成模型 H3,benchmark 上与 seedance2.0 打得有来有回,成本约为后者的 1/2 至 1/3。已有博主用 5090 甚至 4060 显卡在本地跑起来,作者提醒量化版本可能有质量损失。作者把它与 DeepSeek-V4-Flash 以将近 1/100 价格达成接近性能作对比,认为视频生成仍是无限接近但尚未真正到来的 DeepSeek 时刻。
一张在外网流传的 DeepSeek 成本性能图显示,DeepSeek-V4-Flash 正式版的 cost per task 为 GPT-5.6-Sol 的 1.6%、Opus5 的 1.3%、Fable5 的 0.95%。
AI 订阅制被类比为健身房会员卡模式,厂商赌用户少用、用户想全部用满,由此产生关闭订阅入口、rate limit、5 小时/7 天 token 限额等矛盾。文章认为 DeepSeek 只提供 API、把精力放在提升模型能力和降低成本上,是更简单的路径,并判断订阅制可能只是 AI Agent 推广期的阶段性产物,未来厂商或将回归 API 定价。