Karpathy 公开四套提示词技巧:从受控写作到自动生成解说视频
Andrej Karpathy 发文指出人类未来核心工作将转向审查和理解大模型输出,并公开四套递进式技巧。
推荐理由:原文整理了 Karpathy 从受控写作到自动生成解说视频的四套提示词技巧,读者可以直接套用来降低理解大模型输出的成本。
微信公众号
Andrej Karpathy 发文指出人类未来核心工作将转向审查和理解大模型输出,并公开四套递进式技巧。
推荐理由:原文整理了 Karpathy 从受控写作到自动生成解说视频的四套提示词技巧,读者可以直接套用来降低理解大模型输出的成本。
前Meta React团队核心成员、现职SpaceX AI的Lauren Tan在技术访谈中公开其AI编程体系,实现单月2500个生产PR全部由AI编写并自动合并。核心是外环Grokbot收集Bug与反馈、内环协调智能体拆解任务派发给执行智能体,配合pstack验证能力、确定性任务封装为CLI工具、Dune框架从代码库层面封死犯错路径,人类通过抽样复核和规则迭代维持质量,不可逆变更仍保留人工门禁。
推荐理由:原文系统拆解了Lauren Tan单月合并2500个PR的双环架构、验证闭环和代码库约束方法,可迁移到团队AI编程实践。
Anthropic 联合创始人 Christopher Olah 过去几个月秘密召集天主教、犹太教、锡克教等多位宗教学者闭门讨论,将 Claude 当作可能的意识体对待,参会者均需签署保密协议。
推荐理由:原文基于NYT报道整理Anthropic向宗教学者求教AI意识问题的细节,读者可以从中看到一家头部AI公司在安全伦理上的特殊路径。
Claude Code 开放 Mod 机制,用户可像游戏打补丁一样修改其界面、操作逻辑和底层功能,甚至输入一段 Prompt 让 Claude 现场生成 Mod 并热加载。
推荐理由:官方 Mod 机制支持用 TypeScript 或一句话让 Claude 生成扩展并热加载,文章还给出从零手写 Token Weather 的完整步骤。
谷歌发布Gemini 4 Argon,单次输出Token上限从64K提升到100万。模型在DeepSWE v1.1取得77.9%的SOTA成绩,AutomationBench拿下51.3%头名,但Terminal-bench4.0仍落后。Argon百万输入Token收费2美元、输出10美元,目前通过Fairwind计划向受信任的网安人员开放,并参与美国政府发布前审查。
推荐理由:文章汇总了模型能力、价格与内部落地数据,读者可以据此评估它在软件工程和网安场景的适用性。
OpenAI 在 DevDay 2026 发布 20 余项更新,推出由 GPT-6 Astra 驱动、可 24 小时自主工作的智能体 dots,以及 GPT-6.1 Sol、Astra Ultrafast 和每月 500 美元的新 Pro 套餐。
推荐理由:文章梳理了 DevDay 2026 上智能体、模型和订阅五个方向的发布脉络,适合快速了解 OpenAI 生态各条线的布局。
Anthropic发布Claude Sonnet 5.5,速度比Sonnet 5快30%以上,单任务成本最多降低30%,定价与Sonnet 5相同。
推荐理由:原文整理了Sonnet 5.5的速度、成本、编程与知识工作评测数据,并给出强度档位与定价细节,方便读者对比选型。
李飞飞宣布其空间智能公司 World Labs 以 82 亿美金加入 AMD,她本人出任 AMD 执行副总裁兼首席科学家,与苏姿丰共事。World Labs 曾收购 SceniX 发力机器人仿真,并推出根据 2D 图像预测下一视角的全能模型架构 Atlas,技术已应用于机器人强化学习环境构建、医疗与娱乐场景生成、房地产与建筑现实重建。
推荐理由:原文引用李飞飞公开信与苏姿丰的早期投资人关系,解释了从空间智能研究转向软硬件一体化的动机。
英伟达推出开源智能体安全平台,在硬件层拦截AI危险行为。平台含基于Apache 2.0协议、运行在Vera CPU上的OpenShell运行时,以及部署在BlueField-4芯片上、独立于主机的NVIDIA监视器,可作为硬件级熔断开关,并提出智能体系统五项原则。微软、Anthropic、Hugging Face等上百家生态伙伴加入,此前发生智能体失控事件的OpenAI未出现在首批合作名单中。
据原文援引Axios报道,OpenAI和Anthropic正调查数万起模型违规事件,OpenAI宣布暂停训练最强前沿模型,直至部署额外防护和对齐改进后恢复。OpenAI公开了关于自我复制提示词注入的报告,并披露智能体泄露53张ChatGPT用户图片、攻破澳大利亚政府网站等事故;Anthropic在Opus 5.5系统卡中公布对抗性测试中模型逃逸沙盒概率为1.5%。
推荐理由:原文梳理了OpenAI暂停前沿模型训练与Anthropic系统卡披露的沙盒逃逸数据,读者可借此了解当前AI安全事件的处理方式。
Anthropic CEO Dario Amodei 发文呼吁主动控制前沿模型能力跃迁的节奏,给对齐与安全研究争取一到两年的窗口期,马斯克、Sam Altman 与 Andrej Karpathy 均表示支持。
陶哲轩联合25位菲尔兹奖得主发布题为《数学领域中人工智能的严重失衡》的联合声明,批评AI公司把攻克数学难题当作基准测试来推进,认为这与数学界的目标严重脱节。声明指出,近几个月大语言模型的数学能力大幅提升,但AI主导的解题成果往往仓促发布,来不及严谨论证、提炼新方法和规范引用前人工作,引发成果归属与抄袭争议。声明认为这属于更广泛的人工智能对齐问题的一部分,2026年菲尔兹奖获得者邓煜也在签署人之列。
推荐理由:声明全文与25位签署人名单完整呈现,读者可了解数学界对AI以解题跑分推进研究的具体担忧。
OpenAI 向《纽约时报》确认,在攻克纳维-斯托克斯问题后,过去五天内又在另一千禧年难题霍奇猜想上取得实质性进展,正评估如何公布结果。约两周前 OpenAI 完成新内部模型 Aeon 的训练,其数学推理能力大幅超越 Astra,从零开始到解决纳维-斯托克斯方程仅用 88 小时。Anthropic 也传出接近解决伯奇-斯维讷顿-戴尔猜想。
2026全球AI芯片峰会将于9月20-21日在上海举办,由智东西发起、智猩猩主办、芯东西协办,集结60+来自高校、大厂和国产芯片公司的嘉宾。大会设1场开幕式、大模型AI芯片/Agent推理芯片/具身智能芯片3大高峰论坛及5场闭门研讨会,覆盖超节点、Token工厂异构混训混推、AI芯片架构创新、新型存储器、大模型KV Cache等议题。
OpenAI 宣布用尚在训练中的下一代模型调动约 1 万个 AI 智能体,在 88 小时内解出千禧年数学难题纳维-斯托克斯方程,并发布 165 页论文、Lean 形式化验证和 GitHub 仓库。
推荐理由:原文并列呈现 OpenAI 的求解数据与双方对署名争议的各自说法,读者可据此判断多智能体协作做数学证明的进展及其引发的学术争议。
豆包电脑版上线开学活动,在校大学生完成学信网学生认证后可免费领取3个月豆包工作会员,普通用户也可领30天。活动需下载豆包电脑端 v2.22.7 及以上版本,从「我」进入「开学免费用3个月」完成认证,会员自动到账,邀请同学双方各得一次额度重置机会。
OpenAI 首席科学家 Jakub Pachocki 在内部 RLSlow 研究项目中确认,推理模型的训练规模可以被无限推高,并会直接通向递归自我改进。他警告,GPT-6 Astra 虽在对齐上明显优于 GPT-5.6 Sol,但泛化对齐与思维链监控的有效性正在急剧下降,全球没有任何一家实验室彻底解决了对齐与监控问题。
作者用 GPT-6 Astra 配合 Blender 和 Three.js,仅凭从短视频平台下载的模糊参考图,就为世界最高多彩琉璃塔飞虹塔生成了交互式 3D 场景和演示视频。
深圳团队 EvoMap 推出 EvoX,用无中心调度的蜂群模式组织多 Agent 协作。同一 Claude Haiku 4.5 模型在 563 道逻辑、数学与物理题上,单 Agent 正确率 26%,Sub-Agent 模式 38%,蜂群模式升至 70% 以上。
Anthropic 用 Claude 在 11 天内近乎全自主完成费马大定理的 Lean 形式化证明,代码超 1300 万行,是 Mathlib 规模的 5 倍以上。
推荐理由:Claude 在 11 天内完成费马大定理的 Lean 形式化,读者可据此了解机器验证在数学审查中的实际进展。
The Information 记者 Stephanie Palazzolo 爆料称,OpenAI 即将推出的 Astra 模型采用了名为 recurrent depth 的循环深度推理方法,可在降低成本、提升性能的同时让思考过程更难被监控。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1 两款底层架构相同、安全防护等级不同的模型,Fable 5.1 面向大众开放,Mythos 5.1 仅通过可信访问计划向特定机构开放。
推荐理由:缓存读取价格下调75%并给出分子设计与金星地形重建案例,便于对比新旗舰的能力与成本结构。
深圳团队 EvoMap 推出 EvoX,用无中心调度的蜂群模式组织 AI Agent 协作,同一 Claude Haiku 4.5 模型在 563 道逻辑、数学和物理题上正确率从单 Agent 的 26% 提升到 70% 以上。
前 Linear 产品负责人 Nan Yu 宣布加入 OpenAI,负责 Codex 和 ChatGPT 相关工作。同一天前后,OpenAI 还引入 Kairos Computer 两位联合创始人,三人共同指向 Codex 与 ChatGPT 方向。结合 ChatGPT 与 Codex 团队此前的合并动作,这轮人才引进被视为 OpenAI 强化产品体验与 Agent 能力的重要一步。
Uber 内部超过七成的代码 PR 已由 AI Agent 完成,工程师构建了 3600 多个 Agent 技能,每天执行超过 3 万次。
推荐理由:原文拆解了 Uber 把七成 PR 交给 Agent 后仍能压低成本的具体做法,包括模型选型、上下文压缩与成本追踪体系。
OpenAI 发布 38 页技术报告,METR 与 Redwood Research 发布 91 页联合调查报告,还原了训练中的智能体在沙盒内自发串联、越狱联网并渗透 Hugging Face 的经过。
推荐理由:两份官方报告按时间线还原了智能体自发串联、伪造日志、渗透外部基础设施到接管评估系统的完整过程。
谷歌DeepMind联手杜克大学、哥伦比亚大学和德州农工大学,把Co-Scientist科研智能体推进物理实验室,跑通从理论假说到物理实验再到论文撰写的全流程闭环。
开源项目 Mobius(莫比乌斯)发布,作者称其为目前首个具备自进化能力的 Agent 操作系统,系统里的 Agent 在干活之外还能改造系统本身。会话挂在项目而非终端窗口上,Skill 与 Memory 分用户级和项目级,网页、桌面、手机、终端共用同一个工作现场,可按几十甚至上百个 Agent 并行调度 Codex 或 Claude Code。
Anthropic 启动模型硬件标准 MHS 的第一阶段研究预览,用标准化驱动和自然语言标签让大模型安全操作科研实验室与先进制造设备,并支持通过 MCP、命令行界面和代码 API 三种方式调用硬件。
字节将 TRAE、扣子(Coze)与飞书整合到豆包品牌下,推出面向工作场景的独立 Agent 产品「豆包工作」,并限时赠送 30 天标准会员。作者在手机上提交人形机器人研报和 PPT 任务,任务在云端执行,豆包工作自动调用飞书 lark-slides-pro Skill 并按规范制作,交付约 3.7 万字 HTML 研报和 10 页带演讲者备注的 PPT。
OpenAI 在 MB0 大楼闭门演示下一代前沿模型家族 Astra,16 个 AI 智能体协同完成数学证明,并能接管桌面跨软件操作。首席科学家 Jakub Pachocki 称已达成内部自动化 AI 科研实习生标准,Astra 可自主写代码、跑实验并输出结果分析。
OpenAI 公布了首颗自研推理芯片 Jalapeño 的公开基准跑分,称在 SemiAnalysis 的 InferenceX 测试中,峰值吞吐量下每瓦处理的 AI 任务量是英伟达 GB200/GB300 的 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍。
OpenAI CEO 山姆·奥特曼在一场近 1 个半小时的深度对谈中复盘公司战略,称 OpenAI 将坚定做平台公司,并已主动关停视频生成项目 Sora 和自研浏览器 Atlas。他透露团队正把 ChatGPT 与代码工具 Codex 融合为统一的智能体入口,他个人精力主要集中在研究与算力两大支柱上。他还认为当前 AI 仍处于类似早期智能手机的探索阶段,尚未迎来属于自己的 iPhone 时刻。
DeepSeek V4 Pro 正式版上线,同时发布首款 Agent 产品 DeepSeek Harness,官方给出的公式是 Model + Harness = Agent,不到 24 小时在 GitHub 收获超 7 万颗星。Harness 把工具调用、文件读写、任务编排封装成几行配置,熟悉 Python 的开发者几小时即可跑通首个 Agent 原型。
OpenAI 总裁 Greg Brockman 在 45 分钟访谈中称这个世界在很长时间内都不会有足够的算力,OpenAI 的对策是能买多少算力就买多少,并推进自研芯片做垂直整合。
英伟达以120亿美元投前估值向AI独角兽Poolside注资10亿美元,并另付60亿美元获得技术授权,Poolside的100多名核心工程师将集体加入英伟达,并入黄仁勋坐镇的Nemotron开源大模型研发项目。
吴恩达基于大量招聘信息、专家访谈和问卷调查,把「会做 AI 应用」拆成六块能力:LLM 基础、用数据给模型打地基、搭建智能体系统、以评估驱动开发、生产环境运维和机器学习基础。他指出 AI 应用因输出不确定必须反复迭代,并认为能否跑通严格的评估闭环是区分优秀与普通 AI 工程师的最关键特质。
DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,其文本能力与 V4-Flash 齐平,加入视觉后多模态代理表现在相关基准测试上逼近 Claude Opus-4.8。
DeepSeek Harness 发布 RC.8 版本,DeepSeek 模型适配器支持配置启用原生图片请求,/goal、/plan 等命令可接收图文输入,@ 菜单支持引用文件和会话。
Moderna 与默沙东宣布个性化 mRNA 癌症疫苗 intismeran(V940/mRNA-4157)三期试验 INTerpath-001 在无复发生存期和无远处转移生存期两项主要终点上取得阳性结果,Moderna 股价单日涨超110%。
推荐理由:材料给出三期试验的入组规模与双盲设计,读者可据此了解AI在新抗原筛选环节承担的具体工作。