DeepSeek 在 API 平台上线多模态实验模型 deepseek-v4-flash-vision-exp
DeepSeek 在 API 平台上线实验模型 deepseek-v4-flash-vision-exp,开始提供图像理解服务,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 一致。
按公众号阅读文章与观点
DeepSeek 在 API 平台上线实验模型 deepseek-v4-flash-vision-exp,开始提供图像理解服务,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 一致。
DeepSeek 发布多模态大模型 DeepSeek-V4-Flash-Vision-Exp,可在 Coding Agent 里直接识图,文中称其能力接近 Opus-4.8。
智谱 GLM 5.3 与 GLM 5.2 在同一题目下从零开发基于 OpenStreetMap 数据的北京国贸至望京 3D 驾驶游戏,两者均端到端完成并支持断网运行,GLM 5.3 用时 50 分 47 秒,快于 GLM 5.2 的 66 分 1 秒。
DeepSeek 上线独立多模态模型 DeepSeek V4 Flash Vision EXP,据称其多模态 Agent 能力已逼近 Opus 4.8,纯文本能力与 DeepSeek V4 Flash 一致。
Tom's Hardware 依据 PCPartPicker 零售历史价格统计,2025年8月至2026年8月 DDR5 内存全线大涨,64GB DDR5-5600 套件同比涨485%,128GB 套件从329美元涨到3399美元。
推荐理由:文章用多家渠道的零售价数据,勾勒出AI算力需求如何经由HBM与服务器订单挤压消费级内存产能的传导路径。
超维动力在WRC现场展示全栈具身智能系统,包括全尺寸人形机器人KAI Bot、37自由度灵巧手KAI Hand、数采头环KAI Halo、KAI World Model及KAI Embodied AI Infra。
Cloudflare 推出开源运行时 Cloudflare Computer,为 AI 智能体提供更接近真实计算机的持久化运行环境。该运行时由平台决定代码在 isolate、容器沙箱还是 Web 浏览器中运行,isolate 可持久保存智能体状态并在空闲时休眠,基于 SQLite 的共享文件系统让 isolate 与容器之间无缝转移任务。
代号 Ox Alpha 的匿名模型在 OpenRouter 上线,拥有 100 万 Token 上下文窗口、最大 13 万 Token 输出,支持文本、图像和视频输入以及工具调用,当前输入和输出价格均为零。
DeepSeek 多模态模型 deepseek-v4-flash-vision-exp 已上线,可通过 API 访问,价格与 ds4f 保持一致。在需要视觉理解的 Agent 基准上,新模型相比 ds4f 大幅跃升,多模态 Agent 能力已接近 Opus-4.8,其中 Terminal Bench 2.1 得分为 83.9。
DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,用户可通过设置 model='deepseek-v4-flash-vision-exp' 访问。
Generalist 发布新一代机器人基础模型 GEN-1.5,采用 Physical Prompting,让机器人看完一次 3 到 12 秒的人类演示就能执行陌生任务,且不更新模型参数、不重新训练。
北京智源人工智能研究院等机构在 IJCAI 2026 发表综述《Towards Automated Kernel Generation in the Era of LLMs》,系统梳理大模型自动生成 CUDA、Triton、ROCm、AscendC 等后端核算子的技术版图。
IJCAI-ECAI 2026 颁出四项论文奖:1990 年的非单调推理论文获 AIJ 经典论文奖,2021 年的 Logic Tensor Networks 获 AIJ 杰出论文奖,2002 年的 SMOTE 获首届 JAIR 时间检验论文奖,2021 年关于二元分类器解释计算复杂性的论文获首届 IJCAI-JAIR 最佳论文奖。
Bun 1.4 稳定版于 8 月 20 日发布,这是 Rust 重写后的首个稳定版本,也是 Bun 被 Anthropic 收购后的第一次大版本更新,距上一个稳定版 1.3.14 已过去 99 天。
Meta公开了以Coding见长的Muse Spark 1.2的具身能力,模型可读画面、拆任务、定路线、调工具,并指挥双臂机器人整理桌面。官方架构显示整套机器人系统分上下两层,上层为Muse Spark专用变体负责理解场景与拆解子任务,下层由同系列VLA模型执行。
Generalist AI 发布机器人基础模型 GEN-1.5,机器人只需看3-12秒的动作示范,在0梯度更新、0微调的情况下就能上手新任务,还能把两段演示串成一个连续任务。
25岁高盛分析师 Darren Zhou 分手后在 ChatGPT 写下绑架、性侵、谋杀前女友及其家人的详细计划,OpenAI 安全系统检测到威胁模式后转人工审查并通报 FBI,FBI 调取其两个月聊天记录交给当地警方。
今年 WRC 上,具身智能公司不再争论 VLA 与世界模型谁是机器人大脑的最终路线,转而聚焦"采什么数据、怎么采"。擎朗智能称 VLA 是核心骨架、世界模型让其"先想后做",自变量推出 QUANXTA Zero 无本体数采方案、数据入库有效率超 85%,奥比中光则发布 EGO、UMI、WristCam 和 Hub 覆盖真实交互关键视角。
商汤开源 SenseNova U1.5 Lite 正式版,一款轻量级原生统一多模态模型,原生支持 2K 和 4K 图像生成,并支持单图、多图参考以及 Bounding Box、Visual Marker 等控制方式,可用于元素插入替换和局部精修。
文章认为,围绕「AI焚书」的愤怒更多指向象征意义,而非已经发生的实际损失。规模最大的 Anthropic「巴拿马计划」一年花数千万美元破坏性扫描数百万本实体书,而 World of Books 一家2024年就卖出3100万本,版权案文件显示扫描后每本书会变成含整页图像和机器可读文字的PDF。
DeepSeek Harness(DSH)发布的是一套可热重载、everything-is-a-plugin 的 harness,把 model adapter、tool registry、sandbox policy、subagent backend 甚至默认 Agent Loop 都做成可替换、可撤销的 Cordis 插件。
商汤科技正式开源 8B 生图模型 SenseNova U1.5 Lite,官方称其在复杂排版与精准编辑等场景可比肩闭源的 GPT-Image-2。该模型延续 NEO-unify 原生统一多模态架构,训练时先分别训练文字渲染、美学表达、图像编辑等专项 Expert,再通过多教师在线策略蒸馏 MOPD 融合回同一个 8B 模型,交付和部署时仍只有一个模型。
Anthropic 公开 Claude Academy,把新员工入职培训内容做成 23 门免费课程,入口为 academy.claude.com 或 Claude 个人资料菜单里的 Learn more。课程分产品入门、智能体开发、AI 素养和角色专项四条主线,最长的一门 67 节课约 9 小时。培养标准是 AI 流畅度,材料围绕 4D AI Fluency 框架和四条课程设计原则展开。
MiniMax 推出视频生成 Agent 产品 MiniMax Design,以 Agent 作为创作入口,把脚本、分镜、图像、视频、配音和剪辑组织在同一张 Canvas 上,用户描述产品、受众、平台和卖点后由系统完成成片。
InfoQ 认证架构师在线活动参与者提出,应将可理解性视为演进式架构的固有特性,因为不被理解的系统无法安全演进。文章指出知识碎片化、团队人员流动和生成式 AI 是削弱可理解性的三大因素,其中 GenAI 压缩了原本用于构建心理模型的实现工作量。作者建议用适应度函数监控 PR 规模、知识分布、入职摩擦和意图文档缺失等信号,并通过设计评审与人工检查点把握设计意图。
美图影像研究院(MT Lab)提出面向开放词汇的自提示(Self-Prompting)场景文本编辑方案,已被 ICML 2026 录用。该方案从输入图像提取像素级风格信息并结合目标文本生成字形提示,经多模态扩散 Transformer 统一建模,无需额外编码器即可端到端编辑。
文章提出 Agentic OS 应让传统 OS 继续负责文件系统、设备通讯与任务调度,LLM 则位于更高语义层理解用户意图、规划步骤并选择工具,对应 UX 层可称为 Intent-oriented User Interface。
深势科技正式发布玻尔·科学空间(公开测试版),为科研人员提供连接本地与云端数据、计算和实验资源的统一桌面工作环境,并内置 SciMaster、BioMaster、PharmMaster、MatMaster 等 AI 学科专家。
Spark-to-Paper 是一套以 13 个可组合技能运行在现有编程助手内的端到端论文生成系统,可从一句研究想法完成文献检索、实验设计执行、论文写作与可编辑配图,直至输出可直接编译的 LaTeX 项目。
墨奇智能在世界机器人大会首次公开亮相轮式机器人 MORPHI KINO,并发布 Agentic-Native 技术路线与 MoRA(MORPHI Reasoning & Autonomy)具身模型架构,将目标维护、执行记忆和进度判断从 System 2 下沉到 System 1。
量子位面向 AI 产业、AI 财经、AI 产品三个方向招聘编辑、主笔、主编,岗位均在北京中关村全职,校招接受实习且可转正。产业方向覆盖芯片、AI Infra、云计算,财经方向聚焦创投与财报,产品方向关注 AI 应用与硬件终端落地。简历投递至 zhaopin@qbitai.com,需附代表作品。
在 WRC'26 物理AI引领者论坛上,跨维智能、商汤科技、地瓜机器人、临界点等企业嘉宾达成共识:具身智能的真正引爆点不是模型,而是能持续生产、回收和复用高质量数据的体系。
墨奇智能在 WRC 2026 首次公开展示自研具身智能模型架构 MoRA 及轮式机器人本体 MORPHI KINO,后者用 15 分钟自主完成清理桌面、检查冰箱库存并补货、洗烘折叠衣物等家居长程任务,全程无需人工指挥。
深势科技发布玻尔·科学空间(公开测试版),一个面向科研人员与 AI 科学家协同工作的桌面端环境,研究者只需提问和确认,调研、假设、验证、复现、成图、审稿等工作由系统接管。
蚂蚁灵波在2026年WRC展示搭载全栈大脑2.0的机器人在上海国大药房门店承担夜班药品分拣,并计划今年采集百万小时数据。其7月发布的LingBot-VLA 2.0等六款具身开源模型预训练数据达6万小时,已适配17个机器人品牌、20种构型。首席科学家沈宇军称具身数据需做到百万小时起步,才可能迎来具身智能的ChatGPT时刻。
WRC 2026 上,具身智能厂商的展示重心从本体 demo 转向大脑能否稳定干活、能否算过账。原力灵机用 DM0.5 泛化模型实现约 2 秒/件的包裹分拣,自变量以 WALL-B 大模型展示翻面分拣,星动纪元则靠全栈自研与广东邮政等落地场景建壁垒。优必选 Walker S2 支持 3 分钟自主换电,银河通用发布推理延迟 0.39 毫秒的 AstraBrain-WBC 0.5 通用小脑模型。
豆包工作任务模式密集更新,上线技能商店、连接器和可以分工协作的工作伙伴三项能力,让 AI 从一问一答转向规划步骤、操作电脑并在飞书等系统中交付结果。机器之心用一段不到 400 字的提示词搭起从选题到成稿的编辑部流程,豆包可操作 Windows 电脑、在云电脑中持续运行并由手机远程查看和调整。
AutoDesign 提出 MetaHarness Optimization,让 DesignHarness 通过内外循环自我进化,Paper-to-Poster 任务的得分经多轮自迭代从 49 提升至 80.9。
Anthropic 将 Claude Code 原定 8 月 19 日结束的 +50% 周额度加成延长到了 8 月 31 日,文章借此讨论 Agent 长任务的 token 消耗结构。
归藏的 AI 工具箱为自己开发的 PPT Skill 更新了演讲者视图,安装后按 P 键或点右下角的 P 演讲模式即可切换,并弹出单独的观众窗口,无需 PowerPoint 插件也不用联网。