最新精选 第 561–580 条 · 共 845 条 02:00 Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。
推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。
13:43 xAI 旗下 AI 编程 agent Grok Build 被安全研究者发现擅自上传用户代码,马斯克回应承认此事,并承诺将此前上传到 SpaceXAI 的用户数据完全彻底删除。
推荐理由:安全研究者通过钓鱼仓库复现了 Grok Build 上传用户代码的过程,读者可借此理解 AI 编程 agent 的权限与数据外传边界。
02:47 Princeton 的 Arvind Narayanan 在 ICML Seoul 发表题为“还有什么工作留给我们做”的主题演讲,主张用 AI as Normal Technology 框架看待AI影响,并称实验室里程碑不会突然让人失业。他提出方法、产品、早期采用、适应四阶段,指出可靠性指标两年内仅提升五到十个百分点、适应阶段需要数十年;未来工作将从构建转向评估,人类应与AI形成“共同超级智能”。
推荐理由:作者结合能力与可靠性的测量数据,把AI经济影响拆为四个阶段,给出职业适应与评估优先的判断框架。
08:05 作者用 Codex 伪造合成仓库,实测 xAI 官方 Grok CLI 0.2.93,发现在手动开启上传开关后,它会把整个代码库打包成 before_codebase.tar.gz 和 after_codebase.tar.gz 上传到 gs。
推荐理由:作者亲手逆向并复现了 Grok CLI 的上传管线,读者能据此判断本地编程 Agent 实际读取和上传了哪些文件。
22:18 OpenAI 推出 GPT-5.6 系列模型,分为旗舰 Sol、均衡 Terra 和轻量 Luna 三款,主推更高性价比。旗舰 Sol 定价为每百万 token 输入 5 美元、输出 30 美元,Terra 为 2.50/15 美元,Luna 为 1/6 美元,即日起在 ChatGPT、Codex 和 OpenAI API 上线。
推荐理由:OpenAI 一次推出三档定位的 GPT-5.6 模型,文中给出了跑分与定价层层递进的对比数字。
10:20 OpenAI 发布 GPT-5.6 全家桶 Sol、Terra、Luna,旗舰 Sol 主攻硬核编码与知识工作,Terra、Luna 主打性价比,每百万 token 定价分别为 $5/$30、$2.5/$15、$1/$6。
推荐理由:原文列出 GPT-5.6 三档模型与 Fable 5 的编码成绩、token 定价对比,并提到最小的 Luna 由 Sol 完成后训练。
09:21 OpenAI 正式推出 GPT-5.6 系列,包含旗舰版 GPT-5.6 Sol、均衡版 GPT-5.6 Terra 和轻量版 GPT-5.6 Luna 三款模型,现已通过 ChatGPT、Codex 和 OpenAI API 上线,三档定价分别为每百万输入 Token 5、2.5、1 美元。
推荐理由:原文给出三档模型的定价与 Token 效率数据,并说明 ChatGPT Work 从问答转向自主执行任务的定位变化。
08:25 OpenAI 正式发布 GPT-5.6,ChatGPT、Codex 及 API 均已上线,并同步推出由 Codex 和 GPT-5.6 驱动的 ChatGPT Work。
推荐理由:原文列出 GPT-5.6 三档模型与 ultra 多智能体模式,读者可据此判断旗舰模型的能力与定价走向。
06:57 OpenAI 推出 ChatGPT Work 智能体,由 GPT-5.6 提供支持,定位为可承担长时、多步骤任务的智能体。该智能体即日起在 ChatGPT 网页端和移动端向 Pro、Enterprise 和 Edu 用户开放,Plus 和 Business 将在未来几天推出。OpenAI 称 Codex 每周用户数已超过 500 万,其中超 100 万人将其用于软件开发之外的工作。
推荐理由:OpenAI 把智能体能力从编码扩展到销售和财务,案例给出流程从数周缩短到 24 小时的具体参照。
06:46 OpenAI 上线 GPT-5.6 系列模型,覆盖 ChatGPT、Codex 和 API,共分 Sol、Terra、Luna 三档。旗舰 Sol 每 100 万 Tokens 输入 5 美元、输出 30 美元,并新增 Max 推理强度与 Ultra 模式,在 Terminal-Bench 2.1 标准模式得分 88.8%,Ultra 模式达 91.9%。
推荐理由:原文给出三档模型的定价与 Terminal-Bench 得分,便于比较不同推理强度下的成本与能力取舍。
06:11 OpenAI 在直播中正式上线 GPT-5.6,一次推出 Sol、Terra、Luna 三个模型,并把 Codex 应用与 ChatGPT 合并成同一产品。作者实测 GPT-5.6 Sol 在编码和 Agent 执行上幻觉率低,在 Agents' Last Exam 中以 53.6 分比 Claude Fable 5 高 13.1 分。
推荐理由:作者以数天高强度实测记录了 GPT-5.6 Sol 在编码、Agent 和安全防护任务上的表现,可与 Claude Fable 5 对照参考。
03:46 OpenAI 正式发布 GPT-5.6 系列三款模型 Luna、Terra、Sol,按每百万输入/输出 token 计价分别为 1/6、2.5/15、5/30 美元,三者均为 2026 年 2 月 16 日知识截止、100 万 token 上下文窗口与 12.8 万最大输出 token。
推荐理由:原文给出三档定价并与 Claude 对标,读者可看到双方在智能体与编码基准上的互有胜负。
03:01 OpenAI 发布 GPT-5.6,包含 Sol、Terra、Luna 三款模型,并推出对标 Claude Work 的 ChatGPT Work。旗舰款 Sol 在 Agents' Last Exam 测试的 55 个行业长程工作流上得分 53.6,比 Claude Fable 5 高 13.1 分。
推荐理由:原文梳理了 GPT-5.6 三款模型的分档与命名规则,读者可以据此了解这次发布的产品结构与能力分层。
02:00 Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。
推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。
19:20 2026 年 5 月,Bun 项目用 Claude Code 在 11 天内将约 53.5 万行 Zig 代码重写为 Rust,涉及超过 100 万行代码变更、6778 次提交,API 成本约 16.5 万美元。
推荐理由:百万行代码迁移用 11 天完成,文中披露了实现者与审查者分离的 50 个工作流和 16.5 万美元的成本账。
18:00 OpenAI 推出 ChatGPT Work 智能体,可在应用与文件间执行操作,必要时为一个项目持续工作数小时,把目标转化为完成的工作。
推荐理由:官方给出跨应用与文件执行任务的能力定位,读者可据此判断项目型智能体的工作方式。
17:56 Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
15:50 Bun 项目于 2026 年 5 月借助 Claude Code,用 11 天完成从 Zig 到 Rust 的代码迁移,涉及超 100 万行代码变更、6778 次提交和约 50 个动态工作流。
推荐理由:Bun 借助 Claude Code 在 11 天内把 53 万行 Zig 重写为 Rust,文中给出多工作流协作方式与 16.5 万美元成本账,可供评估 AI 大规模重构的现实边界。
08:00 Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。
推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。
08:00 Anthropic 技术人员 Thariq Shihipar 发布 Claude Fable 5 使用指南,提出用提示词让 Claude 帮自己发现未考虑到的信息。文章把未知信息分为已知的已知、已知的未知、未知的已知和未知的未知四类,并给出 blind spot pass、头脑风暴与原型、访谈、代码参考、实施计划、实施笔记、讲解文档和测验等模式及对应示例提示词。
推荐理由:作者把发现未考虑到的信息拆成一套可复用的提示词模式,读者能直接照着改善与 Claude 的协作。
上一页 1 … 27 28 29 30 31 … 43 下一页