Graphite 研究发现 Claude Opus 5.5 与 OpenAI Astra 各有 1.3 万个 AI 写作特征词
Graphite 发布新研究,用 1 万篇 ChatGPT 发布前的文章作人类对照,让各家模型重写后对比用词,找出 1.3 万个在 AI 文本中出现频率至少两倍的写作特征。
Graphite 发布新研究,用 1 万篇 ChatGPT 发布前的文章作人类对照,让各家模型重写后对比用词,找出 1.3 万个在 AI 文本中出现频率至少两倍的写作特征。
Anthropic 发布研究,用 Claude 基于环境结构化程度对约 19,000 个工作任务评分构建机器人暴露指数,发现机器人能完成美国 74% 的物理任务,占全部工作时间的 34%,但仅对 0.3% 的任务具有成本竞争力,按每年约 3% 的价格下降速度需 40 年才达 10%。
推荐理由:报告用 Claude 对近万个任务评估机器人暴露度,给出成本竞争力仅 0.3% 等量化结论,读者可借此理解物理自动化的现实门槛。
物理学家 Matt von Hippel 发文复盘,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 驱动的 Claude Science 完成他提出的挑战。
推荐理由:物理学家亲历 Claude 用千元级预算独立完成九圈振幅计算,给出对 AI 科研能力和低垂果实的第一手判断。
英国王立協会《Philosophical Transactions of the Royal Society A》发布特集号「World Models in Natural and Artificial Intelligence」,Sakana AI CEO 的 David Ha 作为卷首文章共著者参与。
多伦多大学、Vector Institute、剑桥大学和 ServiceNow 的研究者构建出用开源权重 LLM 驱动、靠被攻陷机器 GPU 自我维持并复制的蠕虫原型,完整攻击成功率约 37%。
本期Import AI覆盖多件事:Epoch与METR发布MirrorCode基准,Claude Opus 4.7用14小时、251美元推理成本重实现人类需2至17周完成的程序。
本期Import AI汇总:牛津、UK AISI、斯坦福等机构研究显示AI在4项实验、6923人、18978段对话中说服力稳定超过专家人类,对Save the Children的真实募款效果约为专业劝募员的近3倍。
Import AI 460 期汇总多篇研究。KCL、复旦与 Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的制度漏洞。