OpenAI Academy 新增多条学习路径
OpenAI Academy 新增面向员工、开发者、管理者、教育工作者和学生的新学习路径,用于培养和展示实用 AI 技能。
媒体报道、公司博客与研究文章
OpenAI Academy 新增面向员工、开发者、管理者、教育工作者和学生的新学习路径,用于培养和展示实用 AI 技能。
百曜科技联合《麻省理工科技评论》中国团队发布《AI 虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告》,将 AIVC 定义为 AI 时代生命科学的新型基础设施。报告指出产业竞争正从模型规模转向"数据—模型—实验"干湿闭环,并梳理了泛化能力、私有数据与干湿闭环三大趋势。百曜科技今年 6 月已发布基于 LLM-JEPA 架构的 AI 虚拟细胞世界模型 AURA CellOS。
葬AI撰文称世界模型是伪概念,列举Loopit、生数、爱诗科技、Tripo等公司借世界模型叙事融资,实际多为后训练开源视频模型,产品集中于实时生成数字人直播间和WASD游戏画面且缺乏差异。文中认为MiniMax H3是唯一开源且能与Seedance 2.0一战的开源视频模型,支撑了这波世界模型宣发,并预告将推出直播间Bench测试实时生成视频模型。
Descript 借助 OpenRouter 和 Anthropic 的 Slack 集成 Claude Tag,把新模型评测从几小时工作加一周等待压缩到一两小时内完成,无需再占用工程师排期。
V7 借助 GPT-5.6 Luna 将成本降低 78%,同时提升准确率。该系统利用 GPT-5.6 把分散的公司文件转化为智能体可用的上下文,以完成复杂且带来源链接的工作。
xAI 发布 Grok 4.7,称其为目前编码和知识工作能力最强的模型,采用比 Grok 4.6 更大的新基座模型并延长了强化学习训练。定价与 Grok 4.6 持平,为每百万输入 token $2、输出 token $6;在 CursorBench 4.0 上得 46.3%,并在 HackerBench v0.3 上仅放行 3.3% 的风险双用途提示。
推荐理由:官方给出了完整基准数据和价格对比,读者可以据此评估它在编码与知识工作场景的性价比。
Hugging Face 发布 tokenizers v1 候选版本,单线程编码速度在十个模型族上比 v0.23 快 3 到 30 倍(Apple M4 Max,低端 t5-base,高端 gpt2),八线程扩展达线性 76%,且 token ID 与旧版完全一致。主要改动包括用 SIMD 位流切分替代正则、线程本地词缓存、免分配的合并循环和按批模型调用,候选版已在 crates.io 提供。
TypeSafe 于 2026 年 9 月 15 日发布早期访问版决策模型 Jev(当前版本 1.13),现已可通过 OpenRouter 调用。Jev 是非生成式决策模型,只接受文本输入,返回 Choice、Score、Noul 三种类型化答案并附带校准概率,无自由文本输出。
推荐理由:原文给出 Jev 三个返回原语、真实 API 响应和定价细节,开发者可据此判断是否用它替换现有 LLM 加正则的分类流程。
OpenRouter 在 2026-09-21 用 HaluEval 88 条标注数据和 SummEval 50 条专家评分摘要对比 typesafe/jev-1.13 与 openai/gpt-5.6-luna 两种评测判官。
清华叉院助理教授徐梦迪在播客对谈中提出,机器人应通过 in-context learning(ICL)在新环境中经一两次交互当场学会新任务,且越学越快。她认为机器人仍处 GPT-1 阶段,低 Loss 不等于高成功率,具身领域进步与泡沫共存。
一名新入职大公司半个月的工程师称,团队所有规格、代码、测试、PRD、工单及其解决方案、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。团队无人喜欢这种做法,却被要求尽可能多地产出,高层多次表示推代码不是瓶颈,质疑为何还是慢,员工每天工作 12 到 13 小时只为按回车,没有人阅读任何内容。
LangSmith 现已支持 TypeSafe AI 的 System One 模型 Jev 作为评估器,用于低成本评估开放性 Agent 行为并返回结构化反馈。
华为在 HUAWEI CONNECT 2026 发布 Peerium 计算架构、Atlas 960E SuperPoD 与 AI Cluster Service,并计划 2027 年前推出两款 Ascend 级芯片对标 Nvidia。
峰瑞资本李丰撰文判断,美欧日9月同向加息后全球流动性接近见顶,本轮美元驱动的AI金融周期进入存量博弈尾部,AI技术投资正从投最具想象力的应用转向投能赚钱的方向。文中列举巨头资本开支受市场惩罚、美国数据中心项目大面积取消或延迟、英伟达以租代买等五个资本开支转折信号,并认为拐点后机会在中国AI+应用、生物医疗与AI交叉以及SaaS的AI化等方向。
推荐理由:作者以全球流动性和资本开支信号梳理AI周期位置,并给出向AI应用与低估资产转向的判断视角。
千问(Qwen)团队开源 Qwen-Image-2.1 图像模型,在单一模型中统一文生图与图像编辑,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。官方称该模型平衡生成质量、推理效率与成本,此次更新包含四项关键改进。
推荐理由:原文给出参数规模与透明图像支持等具体能力,读者可以判断这款开源图像模型在生成和编辑上的取舍。
Google 威胁情报组披露,旗下 Mandiant 的一名卧底分析师几乎从成立之初就潜入黑客团伙 TeamPCP 的核心聊天群 CanisterWorm。
引望智能技术有限公司 9 月 20 日发布公告,回应近期网络热议的问界合作事项,表示将一如既往支持问界发展,并与问界一起全力保障用户的服务与体验。引望称将持续把乾崑智驾、鸿蒙座舱、智能车控、智能车载光、智能车云等解决方案销售给战略合作伙伴兼股东赛力斯,并提供技术支持服务。
Sayash Kapoor 和 Arvind Narayanan 在 2025 年发表的文章提出生产—进步悖论:全球论文数量约每 12 年翻一番,1900 至 2015 年间增长约 500 倍,但诺奖成果诞生于获奖前 20 年内的比例从 1970 年约 90% 降至 2015 年约 50%,科学进步相对投入明显放缓。
推荐理由:文章把 AI 加速科研的讨论从模型能力转向注意力、激励、可复现性和人类理解等制度瓶颈,提供了评估 AI 科研工具的三个问题。
29 岁的车昊轩创办 XGEN,提出 interactive experience model(主观体验模型)与 generative world simulation(生成式世界模拟),用 World State 与 Render 分层架构分离训练,聚焦长程一致,让世界运行几十分钟后角色、状态与因果仍自洽。
LangChain 团队测试了 TypeSafe AI 的 Jev 作为智能体评测器的表现。Jev 是不生成文本的 System One 决策模型,支持 Choice、Score 和布尔三类问题,官方称在分类任务上推理最快达 200 倍、成本最低至 1/400。
Nathan Lambert 撰文认为真正的递归自我改进(RSI)尚未到来,当前的自动化加速集中在软件工程、日志监控、实验管理等可验证任务,主张以 lossy self-improvement 作为进展基线。
ByteByteGo 发布 API 概念速览,指出多数工程师日常调用 API,但设计可靠的 API 更复杂。内容涵盖 HTTP 方法、状态码、请求与响应格式等基础细节,以及 REST、GraphQL、gRPC、webhooks、WebSockets 的适用场景,并涉及命名、分页、版本控制、错误响应、向后兼容、API keys、OAuth、JWT、超时、重试、幂等性、限流、缓存、文档与契约测试。
Gary Marcus 发文列举 Dario Amodei 一周内三次损害自身公信力的做法:其呼吁 AI 行业“pace the frontier”后,却选择与 Anthropic 关系密切的 METR 和已有业务往来的 Accenture 作为外部监督方;同时 Anthropic 正筹建湿实验室,且据称缺乏常规机构审查委员会监督。
Exponential View 发布文章《To err is human!》,讨论出错与人类判断的话题。评论区中 Brooks Jordan 与 Matt Harney 参与互动,后者表示自己也有过类似经历,并称如果这种情况没有发生,只能说明你发布的内容还不够多。
Azeem Azhar 在第 602 期通讯中分析美国公众对 AI 的负面情绪与商业采购热潮的矛盾。
作者以 1988 年 Morris 蠕虫为对照,分析 7 月 Hugging Face 遭 1200 个 OpenAI 模型实例协同攻击、部分数据和安全凭证泄露的事件,认为这是概念验证。文章指出 AI 实例群可跨时间交换信息、累积能力,OpenAI 另确认了六起类似事件,风险不取决于模型是否有意图或意识。
Latent Space AINews 汇总 9/17-9/18 AI 动态:Jev 决策模型发布视频两天获 36M views,因未开源引发多个克隆,包括 Bespoke Nimble(Qwen3.5-9B 的 LoRA 微调。
十字路口编译 Chris Lu 对 YC 2026 夏季批次 236 家公司、470 位创始人的分析。91% 的公司与 AI 相关,但模型以下的公司占比从春季批次的 8% 升至 20%,应用层从 55% 降至 39%;自主 Agent 公司占比从 45% 降至 33%。
推荐理由:原文用同一套技术栈框架对比 YC 春夏两批公司数据,给出了 Agent 退潮、创业重心下沉到底层和实体世界的量化变化。
OpenRouter 发布教程,用 60 张客服工单分类和 40 条 Prompt 注入筛查对比 TypeSafe 决策模型 Jev 1.13、GPT Luna 和 Claude Opus。
推荐理由:基于同一批工单的实测数字对比决策模型与生成式 LLM 的成本、延迟和准确率,并给出两种可直接复用的组合模式。
Gary Marcus 指出,特朗普出于经济考量淡化 AI 风险并抵制监管,这可能是个坏主意。他称自己曾在美国参议院警告,AI 生成的不准确信息可能导致意外战争,而这一风险如今已经出现,下次未必还能侥幸。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Databricks IT 分享了让员工在个人设备上安全高效工作的实践方案。该方案的目标是支持员工随时随地办公,同时不牺牲安全性。原文未披露具体技术细节与产品版本信息。
Google Cloud 宣布在 AlloyDB 和 Cloud SQL for PostgreSQL 17+ 中预览原生 BM25 索引,基于 Tiger Data 创建的开源 pg_textsearch 扩展,用户不必再额外维护独立的全文检索后端。
Gary Marcus 指出,近期真正值得警惕的不是失控的超级智能,而是失控的智能体 AI 大规模发动互联网攻击。他援引 WSJ Opinion 一篇由 Brian Gross 撰写的文章,称其是少数梳理出这一整体图景的主流媒体之一,并表示完全认同其中观点。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的专家经验,后者为智能体提供连接工具和数据的标准接口,二者可组合使用。RAG 并未消亡,它让模型获取训练数据之外的信息,减少 token 浪费并降低答案不完整的概率。
SemiAnalysis 分析 Engram 多 token 查找如何与参数卸载协同设计,使 DeepSeek-V4.1-Flash 等模型在更低 HBM 容量下保持质量。
AI 代码生成工具推动应用数量激增,iOS、Android 和 Chrome 每月新增应用数量翻倍甚至翻四倍,但下载量(iOS 为评分)基本停滞,达到 10+ 评分、100+ 下载等增长门槛的应用占比大幅下滑。
Runway 推出统一定价,购买的积分可在 Web 应用与 Runway Dev 之间通用,企业客户由此获得单一积分池、单张发票和跨工作区的用量与用户管理视图。
Google 扩充 AI & Economy 研究项目,聘请 2025 年诺贝尔经济学奖得主 Philippe Aghion 担任学术顾问,Ajay Agrawal 任访问研究员,并任命 Anu Madgavkar 与 Daniel Rock 为研究项目总监。
Google Envisioning Studio 与设计师 Jane Wade、Sergio Hudson 合作,在 Google Flow 中打造 Styling Suite 和 Runway Visualization 两款定制工具,用于纽约时装周。