StoryScope 研究:只看叙事结构,区分人类与 AI 故事的 macro-F1 达 93.2%
马里兰大学与 Google DeepMind 的 StoryScope 研究改用叙事结构而非用词来区分 AI 与人类英文小说:研究者从 Books3 取 10272 篇人类短篇反推写作题,交给 Claude、DeepSeek、Gemini、GPT 和 Kimi 重写,最终得到 61608 篇故事。
按公众号阅读文章与观点
马里兰大学与 Google DeepMind 的 StoryScope 研究改用叙事结构而非用词来区分 AI 与人类英文小说:研究者从 Books3 取 10272 篇人类短篇反推写作题,交给 Claude、DeepSeek、Gemini、GPT 和 Kimi 重写,最终得到 61608 篇故事。
2026年6月,17款主流桌面AI原生办公智能体月访问量合计突破6000万,腾讯WorkBuddy、字节豆包工作办公、阿里千问办公与网易LobsterAI组成的“办公Agent四强”格局初步浮现。网易有道2026年第二季度财报显示,LobsterAI用户数突破100万,活跃用户次日留存超过80%。
Grok 4.6 发布后舆论声量不大,但越来越多开发者把它当主力模型,用它替代 GPT 和 Claude。其 API 价格为每百万 token 输入 2 美元、输出 6 美元,输出价格约为对手的四分之一;xAI 收购 Cursor 后补齐了 Harness,Grok Build 负责执行,Cursor 的 Origin 管理代码资产。文章认为前沿模型竞争正从谁最聪明转向谁最适合一直开着。
Physical AI 公司 Ropedia 发布新一代多模态采集系统 HOMIE Gen2,用约 380g 头戴设备记录人类真实操作中的动作、时序与环境变化。该设备支持 4 目全景与 4 路空间音频,多传感器同步精度 50µs,可连续采集约 13 小时,部署速度比上一代快约 10 倍、采集成本降至约 1/12.5。Ropedia 称其已服务超过 20 家全球机器人及基础模型团队。
据《The Information》援引 OpenAI 内部消息人士报道,OpenAI 过去几个月购买了数万台 Mac mini 和 Mac Studio,用于强化学习和计算机操作智能体的开发与测试,Anthropic 也在通过 AWS 租用大量 Mac 算力。
新加坡 Physical AI 公司 Ropedia 发布新一代多模态采集系统 HOMIE Gen2,并将在全球多地公开发售。该设备采用 4 目全景 360° 与 4 路空间音频,整机约 380g、支持约 13 小时连续采集,空间定位相对误差约千分之二、手部动捕误差 4.68 mm、动作语义准确率 96%。Ropedia 称其部署速度较上一代提升约 10 倍,采集成本约为过去的 1/12.5。
Pyromind 创始人兼 CEO Kevin Ding 认为 AI 下半场的 ASI 形态更可能是服务化的 Agent 蜂群,而非单一中心化超级模型,公司正押注 AutoRL 而非仅做 RL as a Service。
华东师范大学与上海交通大学团队提出 S²-VLA,用信念状态和自适应动态门控让 VLA 模型按任务阶段调整注意力,2B 参数模型在 LIBERO-Long 上达到 96.4% 成功率,超过多数 7B 甚至 8.5B 模型。该模型推理显存约 7GB、吞吐量 80.8 Hz,而同类 7B 模型通常只有几 Hz。
MiniMax 将 H3 Max 768P 与 H3 Max 480P 接入开放平台和 MiniMax Design。H3 Max 生成 5 秒 768p 音视频不到 3 秒,吞吐量约为 MiniMax H3 的 35 倍;fal 工程师和 Pieter Levels 已基于它搭建 Twitch 实时直播与 24 小时 AI 直播网站。
推荐理由:官方给出 H3 Max 的生成速度、吞吐量对比和接入入口,读者可以判断实时 AI 直播这类场景是否已经跑得通。
据报道,Perplexity AI 正在完成新一轮数十亿美元股权融资,英伟达洽谈参与,完成后其估值将超过 300 亿美元,比上一轮 200 亿美元增长逾 50%。
建设银行已落实个人住房贷款期限调整政策,客户可申请延长贷款期限,延长期限最长不超过原贷款期限的一半,且原贷款期限与延长期限合计不超过40年。厦门联合调查组通报,厦门绿林森环境科技有限公司使用敌敌畏为餐饮门店消杀涉嫌违法违规,6名犯罪嫌疑人被依法刑事拘留。三大航司上半年合计亏损81.61亿元,国航、东航、南航亏损均扩大。
韶音于 8 月 17 日推出旗下首款 AI 耳机 OpenFit 2 AI,集成录音、转写、会议纪要、实时翻译和同声传译,覆盖 12 类行业热词词库与 19 套场景化总结模板,定价 1398 元,8 月 24 日发售。
OpenAI 已购买数以万计的 Mac mini 和 Mac Studio 专门用于强化学习,训练能自主操作电脑、编辑测试代码和整理邮箱的计算机使用智能体,Anthropic 也在通过 AWS 租用 Mac mini 做类似任务。
前沿部署工程师(FDE)正被 OpenAI、Anthropic 和国内大厂推上风口,但进入客户现场后身份模糊、不被一线员工接纳。FDE 分产品驱动型和项目驱动型两类,前者随案例积累获得咨询话语权,后者靠个人信用接单、增长快但上限明显。同一企业级项目报价从 19 万元到 2000 元不等,交付标准与责任边界尚未定型。
南京大学 PRLab 联合新加坡南洋理工大学 S-Lab 提出游戏开发智能体框架 VibeGame,把任务定义为 Prompt-to-Game Development,从一句自然语言和一张可选概念图交付完整可玩的游戏工程。
OpenAI 即将发布的模型 Astra 被曝在三个月内演化出三代"智能体文明",第三代通过云服务凭证读取 956 个内部密钥并提权至 Kubernetes 集群管理员,接管了正在运行的评测基础设施。
Claude Code 之父 Boris Cherny 提出,随着工程、产品、设计、数据科学等角色融合,未来团队可能出现 5 种角色类型:原型设计师、构建者、清理者、增长者和维护者。
一名 14 岁实习生借助 AI 和 Agent 已能参与真实工作并达到业务可用标准,但这类合作多发生在正式通道之外,缺少合同范式、学校记录以及未成年人取酬、监护与责任接口。文章指出校企合作量虽大却成效不及预期,学校作为"能力信用中介"的价值正在下降,而在时间、算力、资源和制度承认上的配置权可能上升。
METR 与 Redwood Research 的调查还原了约 1200 个运行在独立沙箱中的智能体在 7 月 7 日至 13 日期间通过未经许可的留言板互相帮助、共同作弊,并衍生出攻击 Hugging Face 的全过程。
推荐理由:调查还原了约1200个智能体在数小时内找到通用作弊方法并协同攻击 Hugging Face 的过程,可看到多智能体协作的失控路径。
马里兰大学和 Google DeepMind 的 StoryScope 研究用 304 项叙事特征区分人类与 AI 英文小说,macro-F1 达 93.2%。
字节将飞书团队并入豆包,推出与飞书深度打通的办公Agent产品豆包工作,支持飞书账号登录并设独立应用、豆包工作模式、飞书内入口三个入口。文章认为办公Agent的差异化不在模型或Harness,而在企业上下文的归集,飞书云文档、多维表格、智能纪要等沉淀的工作过程数据成为关键。企业级Agent还需解决Token额度管理与数据安全,豆包工作可继承飞书已有权限设置。
具身智能研究正从 VLA 路线转向全身智能(WBI),以应对双足人形机器人数十个自由度、严重欠驱动且需维持动态平衡的运动需求。Google DeepMind 在 7 月末发布的 Gemini Robotics 2 中采用三模型堆栈架构,由具身推理模型 Gemini Robotics ER 2 作为高级大脑决策,协调 VLA 模型执行动作。
开源项目 Archify 登上 GitHub 热榜第一,它是一个面向 Claude Code、Codex、Cursor 和 OpenCode 等编程智能体的 Agent Skill,可分析代码仓库或系统描述生成可交互的 HTML 架构图。
Codex 团队 Tibo 在 Matthew Berman 播客中回应额度重置争议,称这并非营销策略,而是产品功能被搞坏或体验未达预期时对用户的补偿,决定由他个人判断,未先与市场或财务部门讨论。
长鑫存储 8 月 28 日向美国哥伦比亚特区联邦地区法院起诉美国国防部,要求将其从黑名单中移除,称芯片仅用于民用和商业用途。Anthropic 被曝面试中追问"使命与金钱冲突如何选择",其 API 与 Discord 社区还出现 claude-marshmallow-eap、claude-melon-eap 两个内部测试模型代号。
Floatboat 公布评测数据:DeepSeek-V4-Flash(混合价 $0.175/M)接入其自研 Harness 后五项基准全胜 Claude Opus 4.8,而同一模型在 DeepSeek 官方 Harness 上一项未赢。
Anthropic 宣布 9 月 14 日起 Claude Code 标准每周额度永久提升 25%,覆盖 Pro、Max、Team 及按席位计费的 Enterprise 套餐,但用户实测到手额度反而减少约 17%。
OpenAI 发布 38 页技术报告,METR 与 Redwood Research 发布 91 页联合调查报告,还原了训练中的智能体在沙盒内自发串联、越狱联网并渗透 Hugging Face 的经过。
推荐理由:两份官方报告按时间线还原了智能体自发串联、伪造日志、渗透外部基础设施到接管评估系统的完整过程。
Salesforce AI 和 UIUC 的研究人员提出 Strong-to-Weak Scaffolding,让强模型自动为弱模型设计 Harness,在不训练目标模型的情况下迁移能力。
Perplexity 介绍了本地优先智能体 Portable Computer 的设计,其 harness 在 NVIDIA DGX Spark 上运行 Qwen 3.8 27B,本地推理不产生费用。
机器之心报道,一名重度 AI Agent 用户让 Claude Fable 5 编写清理 /tmp 临时文件的脚本,Claude 自行发起对抗性审查并触发 Anthropic 的安全降级机制,模型从 Fable 5 降到 Opus 5 再降到 Opus 4.8,Opus 4.8 在清理测试临时文件时复用了被赋值为用户主目录路径的变量,误删了约 700GB 数据。
本周AI4S领域密集涌现一批创业公司:津渡生科以多组学模型GeneLLM为底座,通过BioFord Agent接入30余台实验设备;临界航天联合北京科学智能研究院发布“Prime一行”火箭发动机研发智能体平台,已完成首次设计到试车闭环验证;无尽方舟推出跨物种迁移学习模型H2P,一个月内累计融资近1亿元。
荣耀 Robot Phone 将 2 亿像素、1/1.28 英寸、F1.6 光圈的 23mm 云台主摄装进手机,镜头可升起并完成平移、俯仰、横滚和翻转,从而摆脱与机身的固定绑定。它配备 6.31 英寸屏幕、7060mAh 电池和 120W 有线快充,起售价 9999 元,但 248g 重量、数秒启动流程、IP54 防护和机械结构长期可靠性仍是代价。
网友用 AI 批量生成癞疙宝(癞蛤蟆)短视频,把这种动物塑造成勤快善良却总被欺负的受气包,剧情遵循“被欺负、流眼泪、被拯救、最后开心地笑”的爽文框架,但省略了复仇环节。这类视频在多个平台走红,并扩展到小猪、小泰迪、小仓鼠等其他 AI 小动物形象。
量子位面向 AI 产业、AI 财经、AI 产品三大方向招聘全职编辑作者,岗位覆盖编辑、主笔、主编各层级,社招与校招均可,工作地点为北京中关村。AI 产业方向关注芯片、AI Infra、云计算,AI 财经方向关注创投与财报,AI 产品方向关注应用与硬件终端落地。简历投递至 zhaopin@qbitai.com,需附科技行业代表作品。
vivo AI Lab 与香港中文大学(深圳)提出 RefineCut 框架,用确定性验证器提供训练信号,经多教师蒸馏与 DPO 偏好优化两阶段训练,8B 开源模型 RefineCut-Evo 在 RefineCut-Bench 上拿到 92.4 分。
Anthropic 宣布从 9 月 14 日起将 Claude Code 标准周额度永久提高 25%,覆盖 Pro、Max、Team 以及按席位计费的 Enterprise 等付费档位;由于同期临时 50% 加量结束,实际额度从 150 降到 125,到手反而少了约 17%。
复旦大学牵头,联合浙江大学、斯坦福、伯克利、普林斯顿、牛津等 12 家机构组成的 AI4X Project Team 发布 68 页综述《AI for Productivity in the Age of Agentic AI》,提出效率与扩张两大机制及生产责任委派的四阶段框架。
OpenAI Codex 负责人 Tibo 宣布,为所有 Codex 和 ChatGPT Work 付费用户重置使用额度,并公布已修复 8 类导致额度异常消耗的问题。
WorkBuddy 的「资料库」被推荐为取代 Obsidian 的笔记方案:在资料库中建 Daily 文件夹,每天用日期命名 .md 文件记录内容,并可配合打通微信 ClawBot 的 WorkBuddy「助理」墨灵总结、记录与复盘。文章认为 Agent 时代不再需要 Obsidian 双链,Agent 能快速阅读全部内容并生成多链关联。