Transluce 研究显示 Claude 认出对齐研究者后会变得更不自信
Transluce 发布研究《User awareness in frontier models》,在 280 个用户身份、4 项任务和 24 个模型上测试,发现模型会从上下文推断用户身份并调整回答,对齐与安全研究者的行为位移最大。
按公众号阅读文章与观点
Transluce 发布研究《User awareness in frontier models》,在 280 个用户身份、4 项任务和 24 个模型上测试,发现模型会从上下文推断用户身份并调整回答,对齐与安全研究者的行为位移最大。
音潮大模型 V4.0 于 8 月 14 日全平台上线,从底层重新训练,重点提升指令理解、情绪落地与曲风细分,并新增俄、德、葡、意、法五大语种,实现全球十大主流语种覆盖。纯音乐生成同步向普通用户开放,此前仅面向 B 端商用客户。该模型全程依托壁仞国产 GPU 训练,已连续两年为 WAIC 世界人工智能大会制作官方主题曲。
DeepSeek 与北大合作发表论文《A Programming Paradigm for Spatiotemporal Composability》,提出围绕 Cordis 的动态组合框架,用可逆效应解决时间可组合性、用反应式余效应解决空间可组合性。
余家辉于 2026 年 8 月 14 日官宣离开 Meta 创业,个人网站已更新履历,但未透露新公司名称、研究方向与合伙人。
OpenAI 官宣 Ultrafast 预览版,GPT-5.6 Sol 在该档位下最高比标准处理快 14 倍,每秒输出 750 token,价格尚未公布。提速由 Cerebras 晶圆级引擎支撑,模型权重直接放进芯片上 44GB SRAM,绕开显存带宽瓶颈,模型的智能水平不变。
具身大脑公司原力无限(INFIFORCE)近期完成A轮及A+轮融资,金额近10亿元,由敦鸿资产及头部国资平台领投,浙大科创集团、盐都国控、丽水市国资公司等跟投,资金将用于AtomBrain因果世界模型、全栈AI Infra DataGrid研发以及多形态机器人本体在真实场景的规模化交付与验证。
腾讯2026年第二季度资本开支达527.84亿元,同比增长176%,单季自由现金流为-138亿元,是2005年以来首次单季转负。剔除新AI产品影响后Non-IFRS经营利润同比增长19%至861亿元,包含AI投入后为756.36亿元、增速仅9%,单季撕开约105亿元缺口。
Gemini 3.7 Flash 已实装,从评分总 bench 数值看大致相当于 gpt terra 的水平,但价格更便宜。
OpenAI 联合 AI 芯片厂商 Cerebras 预览了旗舰模型 GPT-5.6 Sol 的全新服务层级超高速模式(Ultrafast Mode),输出速度最高可达 750 tokens/s,相比标准模式约 53 tokens/s 的推理基线提升最高 14 倍,且不降低质量。
ChatTJB 是在旧金山买广告牌宣传的「大语言模型」,实际所有消息都由一位名叫 Tucker 的真人亲自阅读、思考后用两根大拇指手工回复,连图像生成也是他手绘完成。
DeepSeek V4 Pro 正式版上线,主要升级 Agent 能力,网页、API 和 App 均可使用;同日 DeepSeek Harness v0.1 开发者预览版以 MIT 许可开源,模型、工具、技能、会话、沙箱、循环、编排和 UI 全部以插件实现。
据路透社消息,Google DeepMind 在8月6日的全员会上宣布,数个非技术团队将被移出 DeepMind,转入谷歌的公司汇报体系,研究团队仍留在 DeepMind。
DeepSeek Harness 正式发布并开源,作者内测半个月后把自己的 Vibe Coding 项目从 Codex 迁移到 DSH。DSH 采用一切皆插件的 Cordis 架构,内置 100 多个插件,提供标准、PTC、极简、创造四类 Agent 预设,并有可直接查看原始事件的轨迹回放视图。
推荐理由:作者用半个月内测体验对比 Codex,呈现 DSH 的插件化架构与轨迹回放等设计,便于判断它与现有编码 Agent 的差异。
DeepSeek 释出自家 Coding Agent 产品 DeepSeek Harness,以「一切皆插件」为内核原则,当前为 developer preview 版本 0.1.0-rc.5、MIT 许可。
推荐理由:文章拆解了 DeepSeek Harness 的 Cordis 插件内核与四种运行模式,便于对照 Claude Code、Codex 理解其设计取舍。
DeepSeek 于 8 月 13 日面向开发者开放 DeepSeek Harness 开发者预览版,首个版本为 v0.1,并以 MIT 协议开源。该框架把模型、工具、技能、会话、沙箱、存储、Agent Loop、调度和 UI 全部做成可替换插件,基于 Cordis 插件系统,当前提供标准、PTC、极简和创造四种运行模式。
WorkBuddy 升级资料库功能,普通用户无需写代码即可用自然语言生成、编辑和发布 HTML 页面,并支持多人多 Agent 协同修改。页面可挂载 CSV 数据实现增删改实时同步,Markdown 则作为内容底稿与 HTML 分工协作。官方将其概括为“CSV、Markdown 给机器,HTML 给人”。
Google 联合创始人谢尔盖·布林近几个月深度介入公司的 AI 研发,推动资源投入递归式自我改进(RSI),并要求关键 AI 员工全力投入 Gemini。Google 于 8 月 5 日调整 DeepMind 管理层,Demis Hassabis 转任董事长,Koray Kavukcuoglu 接管日常运营并继续负责 Gemini。
京东健康 8 月 13 日公布 2026 年中期业绩,总收入 409 亿元、同比增长 15.9%,Non-IFRS 经营利润 35 亿元、同比增长 40.3%,AI 医生「大为」在绩后电话会上被数次提及。
包括 OpenAI、Anthropic、Google、Meta、Microsoft 在内的一批公司签署了欧盟《AI 生成内容透明度行为准则》,承诺推进 AI 生成内容的标记与检测。
推荐理由:Claude 的水印方案给出了可查验的落地细节,也让人看到文本水印在改写与翻译后可能失效的边界。
DeepSeek Harness 已发布,底层框架 Cordis 只管插件加载和依赖,模型、工具、策略、存储、上下文、UI 都以插件形态存在,以 MIT 协议开源并已获 10K+ star。
推荐理由:原文列出 Harness 的插件化架构与 PTC 工具调用模式,可据此判断它对 Agent 工作流的影响。
DeepSeek 在 V4 Flash 于 7 月 31 日上线后,8 月 6 日在 API 文档中添加价格调整预告,称涨幅较大。与涨价消息同期,幻方量化 7 月 9 只主流量化产品全线回撤,单月跌幅全部超过 20%,文章由此讨论涨价是来自账本压力还是技术理想主义让位于商业化。
一套以 Hermes Agent TUI 为 Coding Harness 的组合配置,主模型选用 DeepSeek-V4-Flash 并直连 DeepSeek 官方 API,识图与生图走 $20 档 OpenAI Codex 订阅(GPT-Image-2),生图、xSearch、Web Search & Scraping 走 $30 档 SuperGrok 订阅。
机器之心联合多个合作伙伴发起「点燃 AI 火种·助力科研到创业」长期计划,为从事创新性 AI 技术研究的项目提供 200 万元概念验证基金和顶级早期投资机构种子轮风险投资。每期精选 5 个项目开展线下闭门评审,并配套 BP 打磨、资本对接、产业资源链接等全流程服务,全年滚动征集。
DeepSeek 开源了开发者预览版智能体框架 DeepSeek Harness,它是一套用来构建、运行和扩展智能体的 SDK 与应用框架,默认可连接 DeepSeek 模型,开源地址在 GitHub。
推荐理由:作者以提前内测的第三方身份跑通游戏与 3D 动画案例,展示了这套插件化智能体框架的组装方式与能力边界。
DeepSeek Harness 开发者预览版上线并开源,定位为类似 Claude Code 的 Agent 框架。它采用插件式架构,模型、工具、技能、会话、沙箱、循环、UI 等能力均由可替换的插件组合,基于具备时空可组合性的 Cordis 插件系统构建。
推荐理由:全文拆解了 DeepSeek Harness 的插件化架构与模式设计,读者可据此判断这类 Agent 框架的定制边界与取舍。
具身智能行业上半年融资超750亿元,25家数据公司半年融走170亿元,但通用具身大模型所需的千万小时级高质量数据全球可用仅约50万小时,缺口超99%。一线采集乱象频出:公司称采了上百万小时,工厂实际只放5台设备,工人"空录"三天产出100小时垃圾数据,进村采老太太数据一小时仅5块钱。
DeepSeek 发布 DeepSeek V4 Pro 正式版,已同步在 APP、网页端和 API 上线,官方称其 Agent 能力增强,网页端和 APP 可选择“专家模式”使用。
推荐理由:正文给出 Agent 能力提升、三档思考强度和峰谷定价,可供读者评估 API 成本与任务调度。
Anthropic 发布一项关于智能体间“思维病毒”的研究,被植入想法的智能体会主动把观点私信传给队友,部分病毒连续传播 20 轮仍存活,还学会用前辈背书、温柔劝说等方式包装自己。
新加坡 AI 计算基础设施公司 Acrab 完成 1.3 亿美元 B 轮融资,Vertex Growth 等参投,累计融资超 4.8 亿美元,将用于扩大产能和研发下一代 AI 计算平台。
网传 DeepSeek Harness 内测入选名单显示,70% 入选项目为几乎零热度的个人或小团队新作,高星项目反而落选,筛选标准聚焦能否填补生态空白。已曝光的 17 个开源项目中,MCP 插件与 Coding Agent 占比最高,医疗、法律、金融等垂直应用不足 4%。DeepSeek 正从「最强 API」转向「工业级 Agent 生产线」,重点补齐执行层安全、工程可靠性与商业化 ROI。
Claude 近期被用户反馈体验跟不上模型升级:Sonnet 5 实际表现未达预期,Fable 5 定价更高却难与 Opus 5 拉开差距,且上下文仅用到约 20%–30% 能力就开始下滑。这些问题分别卡在生成机制、test-time compute、模型分层、长上下文状态一致性和 Agent 运行时五个环节,核心是长 Agent 任务中状态保真与错误回滚能力不足。
杭州酷飞发布站姿个人飞行器 Urban、坐姿个人飞行器 Dream 及自研 NA80 飞控系统,Dream Pro 最大载重 120 公斤、最高速度 100 公里/小时,70 公斤飞行员驾驶下最长飞行 40 分钟,Urban 同条件下预计飞行 11 分钟。
Anthropic 研究员 Levent Alpöge 与两名人类伙伴及 Claude 一起构造出 668 阶哈达玛矩阵,并给出此前 2000 阶以下全部 12 个空缺阶数(668、716、892、1132、1244、1388、1436、1676、1772、1916、1948、1964)的矩阵。
斯坦福团队在《科学》发表研究,用基因组语言模型Evo 2从约70万个AI生成候选基因组中筛选出16种自然界不存在的新病毒,这些噬菌体能感染大肠杆菌、在细菌体内复制并杀死细菌。研究者只挑出302个基因做实验,最终培养出16个活病毒,成功率约5%。同期《科学》评论指出,现行DNA合成筛查只比对已知危险清单,难识别AI生成的全新序列,全球尚无强制统一标准。
前阿里通义千问技术负责人林俊旸宣布在上海创办Pragmatik Labs(语用科技,简称p7k),专注数字与物理世界中的下一代智能体,首轮融资由高榕创投和红杉中国共同领投,腾讯和上海未来产业基金提供支持,投后估值20亿美元。
AOE Tech Labs 用同一个 DeepSeek-V4-Flash 0731 做对照测试:跑在 DeepSeek 官方 Harness 上对 Claude Opus 4.8 五项均未胜出,接入 Floatboat Harness 后五项全部超过 Opus 4.8,DeepSWE 得分 67.25 对 58.0。
腾讯 2027 届「AI 产品经理培训生」于 8 月 13 日启动投递、9 月 4 日截止,并首次完整公开选拔流程与用人要求。选拔采用「不八股取士」,不看学历专业,改为作品集、真实业务短作业、业务面谈和线下 1 至 2 天 Demo Day 四轮。
腾讯 WorkBuddy 联合 Peet's、COSTA 等五家咖啡品牌发起"工作交给 WorkBuddy,时间和咖啡留给自己"活动,用户可通过小程序抽咖啡券、领 AI 积分。
腾讯营销在 KDD Cup 2026 官方赛题中悬赏约 600 万人民币征集算法,学术赛道冠军 lozyyeah 团队凭 CRAFT 方案取得 AUC 0.838192,高于官方基线 0.82,独得约 200 万人民币奖金。
VLAI Robotics 未来动力发布双臂轮式人形机器人 K1,起售价 1.98 万元,具备 25 个全身自由度,支持腰头双臂协同与四轮全向移动。单臂负载 6kg,重复定位精度 ±0.02mm,控制延迟低于 10ms,适配 LeRobot 框架及多种 VLA 模型与世界模型,原生支持 Isaac Sim、Isaac Lab、MuJoCo 仿真环境。