Ilya 的 SSI 被曝探索 TTT 小型推理引擎,规模将扩展 10 倍
网友爆料称 Ilya 创办的 SSI 正在探索基于 TTT(测试时训练)的小型推理引擎,模型会在解题过程中更新部分权重,当前版本最快 8 月向少数用户开放,团队正把下一代规模扩展 10 倍。该路线与 Ilya 此前强调的部署后持续学习一致,英伟达 7 月已宣布与 SSI 长期战略合作并提供下一代 Vera Rubin 系统,算力提升约 10 倍。
按公众号阅读文章与观点
网友爆料称 Ilya 创办的 SSI 正在探索基于 TTT(测试时训练)的小型推理引擎,模型会在解题过程中更新部分权重,当前版本最快 8 月向少数用户开放,团队正把下一代规模扩展 10 倍。该路线与 Ilya 此前强调的部署后持续学习一致,英伟达 7 月已宣布与 SSI 长期战略合作并提供下一代 Vera Rubin 系统,算力提升约 10 倍。
SpaceXAI 发布 Grok 4.6,在 GDPVal-AA v2 拿到 1753 分,反超 GPT-5.6 Sol 的 1728 分和 Fable 5 Max 的 1741 分,AA Intelligence Index 以 61 分与 GPT-5.6 Sol 打平。
Devin 开发商 Cognition 年化收入(ARR)逼近 10 亿美元,比上一轮融资时几乎翻倍,新一轮融资估值目标直奔 400 亿美元,高于 Cursor 被 SpaceX 收购前在私募市场的 293 亿美元估值。
Vercel Labs 发布实验性系统编程语言 Zero,定位为一门速度更快、体积更小且更便于 AI 智能体使用和修复的系统语言,目前版本为 v0.3.4,GitHub Star 超过 5200。
Anthropic Claude Code 团队主导插件与 Agent 设计的 Daisy Hollman 在 NDC Copenhagen 演讲中,拆解了 Claude Code 插件的构成与其上下文工程原语。
面壁智能已向北京证监局提交首次公开发行股票并上市辅导备案,中信证券担任辅导机构,目前尚未披露拟申报的上市板块、募资规模及时间表。辅导备案报告显示,公司注册资本 154 万元,无控股股东,北京清语启航科技中心(有限合伙)为第一大股东,持股 16.45%。
Meta 推出面向本地 Agent 工作负载的开放权重模型 Muse Glimmer,Moonshot AI 的 Kimi K3 则在 License 中写入商业条款:企业经营 MaaS 业务且连续 12 个月总收入超 2000 万美元时,商业使用前需另行达成协议。阿里也在探索 Qwen3.8-Max 面向大规模商业使用的新机制,AI 开源的重心正从开放权重转向开放可继续构建的生态。
良仓孵化器创始合伙人苏杰在 QCon 2026 北京站上,由 AI 数字分身完成主体演讲,提出 AI 折叠时间将解构方法论与岗位边界,未来只有 to C 和 to A,to B 产品将消失。他判断产品形态从“预制菜”式软件转向即用即做的“轻产品”,真正值钱的是生成系统,GitHub 可能成为下一代应用商店。
WorkBuddy 更新远程控制功能,手机端可实时同步电脑端的任务、对话、工作空间和产物,App 需 1.2.0 及以上、电脑端需 5.3.8 及以上并登录同一账号,一台手机可同时连接多台电脑,小程序端操作步骤相同。
鸿蒙元服务通过 ASCF 跨端框架把已有小程序代码直接迁移为场景卡片,京东借此拆分出 200+ 场景卡片并自动适配直板机与折叠屏。ASCF 支持 JavaScript/TypeScript 代码自动转换,一个 20K+ 工程代码的小程序被识别出 121 处异常并由 AI 全量自动修复,左邻永佳则将约 45 人天工作量压缩至 15 人天。
具身智能行业在半年路线争论后转向“世界模型+VLA”混搭,智平方、星海图、小鹏等厂商均称两者并非对立而是互补。VLA 模型同步升级:蚂蚁灵波开源 LingBot-VLA 2.0,融入 6 万小时真实物理数据,RTX 4090 上推理延迟低于 130 毫秒;面壁智能 MiniCPM-Robot 系列参数量仅 1.5B,单次决策延迟 120 毫秒。
一位年轻读者提出:AI 时代个人不必再从事耗材型、垂直型、表演型工作,可直接做作品集,因为"我不行,AI 行"。作者由此讨论 0 基础加 AI 与 100 分基础加 AI 之间的差异。
浙江大学陈静远教授课题组与斯旺西大学联合团队提出自适应非对称适配器,通过预测置信度自动抑制图像塔微调,在 11 个视觉数据集上超越 CoOp、MaPLe、MMRL 等 11 种方法。实验发现文本分支微调收益更高,而 OOD 场景下激进微调图像塔会严重破坏 CLIP 泛化力。该方法在单张 A800 GPU 上训练推理开销低于 MMRL,并兼容 ViT 与 ResNet-50。
浙江大学与清华大学团队提出 SkillTFM,首次将 Agent 领域的 Skill 技术引入表格基础模型,实现免训练适配。该系统通过证据提取、修复技能、门控策略与技能记忆四大模块,仅在证据充分时执行选择性修复,证据不足则保留基础模型预测。
谢扬正式发布 Eazo,一个用自然语言生成可运行 App 的内容平台,产出包含前端、后端、数据库与部署,并以 Feed 流展示和 Remix 他人作品。内测用户已超一万,做出十万多个 App,用户还能调用他人发布的 Skills 并从中分成。
小红书 dots 团队与上海交通大学 X-LANCE 实验室开源 20 亿参数端到端自回归 TTS 基座 dots.tts,在连续隐空间中逐块建模声学,不使用离散声学 Token。
牛津大学和新加坡国立大学团队提出心智世界建模(MWM)框架,将信念、目标、情绪等心智变量纳入世界状态,并实现无需训练的基准系统 MENTIS。在 8 个 LLM 世界模型上,完整 MWM 的最终行为 F1 平均达 87.9,高于直接回答的 63.3;对 gpt-5.6-sol 则从 66.5 提升到 92.9。
飞猪8月10日上线旅行AI产品飞猪帮帮,能力覆盖行前、行中、行后,支持订单退改、酒店升房、值机选座、开票报销等十余项办事能力,并把LUI面板架在GUI货架之上。飞猪CTO陈烨称,用户能在ChatGPT类产品里完成交易的比例仍不足10%,旅行因商品随时间变异、品类难复用、供给侧未为AI准备接口,成为AI落地最严厉的考验。飞猪帮帮交付结果可用率评分较上一代提升超70%,可比任务平均耗时减少近10%。
腾讯 8 月 12 日发布 2026 年 Q2 财报并召开电话会,作者整理出 10 点观察。管理层称 WorkBuddy 按月度互动量排名中国 AI 生产力服务第一,已向其倾斜资源并降低其他新 AI 产品优先级,资本开支排序为混元模型训练、WorkBuddy 推理算力、云。
DeepSeek V4 Pro 正式版与 Grok 4.6 在一夜之间相继发布,两者参数量分别为 1.6T 和 1.5T,作者实测后认为它们从价格与速度两端把行业斩杀线向前推了一截。
腾讯研究院摘选《硅基经济学》第7章提出,硅基智能体因无昼夜节律、无间隔感、可即时切换,其时间拓扑与生物时间根本不同,为生物节律设计的交易时间、结算周期、合同期限和利率期限结构将失效。作者邵怡蕾据此设计碳硅共存的"时间变压器",并提出由CRP、IBP、MME、RVN四组件构成的纯硅基交换协议PSEP,以多边匹配取代价格机制。
DeepSeek 于 8 月 13 日将 V4 Pro 从预览版转正,版本号更新为 DeepSeek-V4-Pro-0813,评测显示其多项测试接近 Fable 5 水平,定价为每 1M token 缓存命中输入 0.025 元、未命中输入 3 元、输出 6 元。
DeepSeek V4 Pro 正式版与 xAI 的 Grok 4.6 在同一夜两小时内先后发布,参数量分别为 1.6T 和 1.5T,作者实测后重新调整了自己的日常 AI 组合。
Grok 4.6 发布,在 Artificial Analysis Intelligence Index 上得分 61,比一个月前的 Grok 4.5 提高 5 分,按马斯克的说法在智能、成本和速度上可以排第一。
DeepSeek V4 Pro 正式版 0813 发布,API 已经更新,Open Code Go 套餐里也已经可以使用。作者提到,从流传的测试成绩来看依然相当突出。
由MATS Research、德国图宾根大学、马克斯·普朗克智能系统研究所等机构组成的研究团队发现,把旗舰模型返回的加密推理块交给同厂小模型复述即可还原隐藏思维链,无需破解加密算法或入侵服务器。
DeepSeek V4 Pro 正式版发布,API 平台已上线 DeepSeek-V4-Pro-0813,官方博客尚未发布。在 HLE、Terminal Bench、Cybergym、DeepSWE 等 Agent 基准上,它几乎全面超过 Opus 4.8,逼近 Fable 5,部分榜单反超;百万 tokens 输入 3 元、缓存命中 0.025 元、输出 6 元。
推荐理由:素材给出多项 Agent 基准对比与 API 定价,可据此判断国产开源模型与闭源前沿的差距及调用成本。
马斯克的 SpaceXAI 上线 Grok4.6,从 Benchmark 看已能与 GPT-5.6-Sol 和 Fable5 打得有来有回,此前 Grok4.5 已接近这两款模型。Grok4.6 目前可在 Grok Build 上使用,作者称 Grok4.5 在 Cursor 和 Grok Build 上效果很好、速度很快,token 耐用度不及 GPT 但强于 Claude。
DeepSeek-V4-Pro 正式版上线,正式版本为 DeepSeek-V4-Pro-0813,输入命中缓存定价 ¥0.025、未命中缓存 ¥3、输出 ¥6。作者提到近期有涨价说法,并称 DeepSeek-V4-Flash-0731 性能贴着 Opus4.8,目前在等 DeepSeek-V4-Pro-0813 的 Benchmark 分数和实测结果。
DeepSeek V4 Pro 正式版上线,版本号 DeepSeek-V4-Pro-0813,Agent 能力接近 Fable 5,Terminal Bench 87.9 对 88.0,Cybergym 反超。
DeepSeek-V4-Pro 已可通过 API 访问,调用节点为 DeepSeek-V4-Pro-0813,价格为每百万输入 3 元、缓存命中 0.025 元、每百万输出 6 元。该模型目前支持 Responses API 和 Anthropic API,官方尚未发布公告。
微信大模型 WeLM 共两款,均为 MoE 架构:WeLM-80B 为 80B 总参数、3B 激活参数,WeLM-617B 为 617B 总参数、23B 激活参数。80B 版本已部署在微信智能体小微,支持用户进行对话与搜索、操作微信原生功能以及调用小程序服务。617B 版本仍在开发中,将以相对适中的激活参数增强通用理解与推理能力。
波浪能公司 Panthalassa 正寻求约 2.25 亿美元新融资,目标估值约 20 亿美元,较三个月前接近翻倍,计划把搭载 GPU 的计算节点部署到远海,用海浪供能、海水散热。该公司 2024 年已完成 Ocean-2 原型部署测试,验证波浪能源捕获、海上设备运行与计算节点部署等环节。
自变量机器人以双机械臂加标准夹爪方案完成公开直播实测,物流分拣效率达 1816 件/小时,超过 Figure AI 此前公开的 1248 件/小时纪录 45% 以上,硬件成本下降 70%,准确率 98%。支撑这一表现的是其自研的全球首个基于世界统一模型(WUM)架构的具身智能大模型 WALL-B,全程 1 小时无人工接管、无固定脚本。
OpenAI前COO Brad Lightcap 发长文宣布离职,称将去做新的事情,此前一个月内安全系统主管 Johannes Heidecke、首席未来学家 Joshua Achiam 和伦理主管 Chloé Bakalar 已相继离开。
ZCode 上线 Goal、Subagents、Remote Control 与闲时任务四大功能,并重置了 GLM Coding Plan 全体用户额度。作者用四轮构建一个 GitHub 数据分析面板来实测,Goal 会按可验收目标自主多轮迭代,并在动手前调用 Subagents 审计代码结构。
研究人员发现,Claude、GPT 和 Gemini API 返回的加密 hidden reasoning 并未始终与原始模型和会话严格绑定,同厂商的其他模型可以读取并转录出可读的推理内容。
迅策科技2026年上半年营收9.67亿元、同比增长389%,归母净利润7251万元,成立十年首次上半年盈利。其以场景Token为核心的2.0业务收入占比仅约10%,定价10-100美元/百万Token,5月Token ARR环比增长320%,公司预计2026年底Token收入占比达20%-30%。
灵御智能凭高性能本体在“申智杯”具身智能比赛三个赛项全部夺冠,其灵御TA2机器人二次开发版已被多个模型开发团队预订。TA2支持远程控制与模型推理统一接口,π0、π0.5等开源模型已完成从数据采集到实机部署的闭环,并已在太原京东七鲜超市常态化运营。灵御智能2026年7月起单月量产100台并全部交付,在手订单金额超1亿元。
一位家长为三年级孩子开发的「诗书空间」小程序 V1.0.0 正式上线,汇集人教版、苏教版、北师大版 1-9 年级全部古诗词,并按地理位置映射到中国地图上。每首诗提供全文、诗人、撰写年份、拼音注音及 1.5-2 分钟音频讲解,内容含朗读、释义、诗人故事和奇妙知识,还支持收藏陌生字、按省份筛选诗词和 Entity tag 关联。