MonkeyOCRv2 以 0.7B 参数在 17 语种文档解析榜单拿下开源第一
华中科技大学白翔团队发布 MonkeyOCRv2,0.7B 版本在覆盖 17 种语言的 MDPBench 上得 83.3 分,0.6B 版本得 82.5 分,均超过此前 3B 参数、80.5 分的开源模型 dots.mocr。
微信公众号
华中科技大学白翔团队发布 MonkeyOCRv2,0.7B 版本在覆盖 17 种语言的 MDPBench 上得 83.3 分,0.6B 版本得 82.5 分,均超过此前 3B 参数、80.5 分的开源模型 dots.mocr。
上海新智具身智能(NeoteAI)联合复旦大学可信具身智能研究院发布三份技术报告,并开源数据与模型。NeoData 数据集与 NeoForce 统一表征模型解决跨设备触觉数据融合难题;VTLA 预测未来 50 步触觉演变,插插头成功率达 85%(视觉方案 60%);TWAM 将触觉引入世界模型,总参数量 72 亿,仿真平均成功率 84.5%。
清华与密歇根大学团队提出一种利用相机自运动作为免费监督信号的方法,无需人工标注或360度麦克风阵列,即可从真实世界互联网视频中学习三维空间音频感知。该工作入选 CVPR 2025 Highlight(投稿论文前2%),并构建了 iPhone Fountain 和 iPhone Music Dataset 两个基准数据集。
Andrej Karpathy 删除 X 个人简介中的 Anthropic 信息后被传已离职,他本人回应称这是"莫名其妙的假消息",并未离职。此前他于 5 月 19 日加入 Anthropic 预训练团队,负责组建新研究团队、用 Claude 加速预训练研究,官宣帖浏览量超 2770 万次。
量子位智库分析内存涨价根源是 AI 引发的结构性产能转移。2025 年 Q3 DRAM 合约价同比大涨 171.8%,三大原厂将 70-80% 先进制程产能转向 HBM 和数据中心,HBM 每 GB 消耗 3-4 倍于普通 DRAM 的晶圆面积。
量子位在悉尼 RSS 2026 现场的交流显示,VLA 与世界模型并不矛盾,PI 的 pi0.7 就包含一个世界模型组件。来自 Sergey Levine 组的受访者称,包括 Physical Intelligence 在内的北美头部具身公司离成熟都还有不短的距离,整个领域也尚未出现真正的奠基性工作。
腾讯混元团队与UNSW在ACL 2026主会长文提出SFT的不完全学习现象(ILP),在Qwen、LLaMA、OLMo2等模型家族(1.8B–14B)和10个数据集上平均有15.3%的样本在训练中见过、loss也收敛,但重测仍答不对。
吴恩达开源了个人桌面 Agent 项目 OpenWorker,采用 MIT 许可证,目前可在 Mac 上运行,Windows 版本即将上线。它可连接 GitHub、Slack、Jira、Notion 等超过 25 种工具,用户自备 API Key 即可接入不同模型,也能通过 Ollama 运行本地模型。涉及发送消息、修改日历或执行终端命令等关键操作前,它会先暂停并请求确认。
科沃斯在苏州成立「八界开源智创空间」,将具身智能机器人「八界」的硬件与底层系统源码免费开放给开发者、高校师生和科研人员。八界采用轮式底盘加六自由度机械臂,臂展800毫米、机身升降44厘米,搭载两颗双RK3588融合SoC,可在本地带动7B参数大模型,并内置AI智能体OpenClaw和Hermes。源码已挂上Atomgit和GitHub,无需申请审核即可使用。
清华大学与腾讯混元团队提出 TRACE(Tree Rollout Allocation for Contrastive Exploration),一个面向 Agentic RLVR 的 rollout 预算分配框架,把 Agent 轨迹视为树,将预算优先分配给更易产生成功/失败对比的 prompt 根节点和中间前缀节点。
Anthropic 正式发布 Opus 5,定价与上一代 Opus 4.8 持平,为每百万 token 输入 5 美元、输出 25 美元,只有 Fable 5 的一半。
推荐理由:Opus 5 以 Fable 5 一半的价格在多项编程评测上反超,读者可以据此比较这代模型的性价比。
Kimi K3 以 1414 分在 Design Arena 单次生成前端榜单中位列第一,超过 Fable 5 和 GPT-5.6 Sol。Design Arena 分析认为其优势源于思维链,K3 消耗的思考 Token 接近 Claude Opus 4.8 的 12 倍,推理过程中编写的代码量是其他 Kimi 模型的 10 倍以上,并靠内部数据索引完成自校验。
智象未来(HiDream.ai)7月23日宣布完成15亿元C轮融资,近三个月内三轮累计融资超21亿元,估值超过10亿美金。本轮由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,安徽、上海、浙江等地国资以及上影股份、华策影视等机构跟投,老股东合肥产投、东方富海等持续加注。
Vivix(灵动时刻)发布实时交互多模态模型 A1 及 W1,用户可像打视频电话一样与屏幕中的虚拟角色持续交流。A1 拥有近30B激活参数,通过 MJD 多维联合蒸馏把视频扩散从 8-Step 压到 2-Step,并配合原生 NVFP4 训推、Encoder/Decoder 解耦与计算通信显存协同调度,实现消费级 GPU 实时生成。
腾讯混元团队联合 UNSW 提出生成式奖励模型 E-GRM,用模型自身多次采样的答案一致性判断输入复杂度,收敛则直答、不收敛才触发 CoT。在 RM-Bench、RMB、RewardBench 三个基准上,约 58% 样本被路由到直答,延迟降低 62%,准确率还有提升。该工作入选 ACL 2026。
阿里硬核少年技术节5.0博见社首次设置北京工业场与杭州学术场两场对话:北京场主题为“AI下一站:从生成内容到构建世界”,群核科技分享将横店部分线下片场扫描重建为线上3D影视基地,并提出视频模型负责审美与语言控制、3D模型负责一致性。杭州场则讨论“从生成式AI到智能体进化”,有嘉宾以电力革命类比,称当前Agent只相当于电灯泡刚被发明。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队的世界模型榜单,支持按指定相机轨迹从单张图或一段视频生成新视角视频,单图3D生成与视频4D生成使用同一套代码、同一个模型。该模型已适配国产昇腾算力,训练数据来自北大系初创企业元空智能,代码和权重已全部开源。
元石科技推出问小白5 Pro,定位“新一代长内容生成引擎”,主打长、稳、可查,用户只需一句指令即可交付长篇成果。它通过跨模态文件沙箱按语义整理资料,理论上可输出无限长内容,有人用它产出十几万字的网文。草稿、引用资料与最终成果均留在工作区,关键数据可跳回原文来源。
Claude Opus 5 提前泄露,网友已放出多轮实测:3D 弹弓攻城、天气卡、厨房场景和 Minecraft 复刻中,其细节密度超过已上线的 Fable 5,有人称其"3D 和 2D 都强"。
新晋菲尔兹奖得主 Jacob Tsimerman 在国际数学家大会开幕式当天宣布,将很快入职 OpenAI,方向是 AI 安全。他在今年 AMS Notices 访谈中称 AI 两年内可能在证明定理上超过数学家,另一篇 arXiv 论文则给 AI 导致人类灭绝的场景建了分类。
新晋菲尔兹奖得主王虹被扒出曾以共同一作身份发表 NeurIPS 2019 论文,研究机器学习中的低秩矩阵近似问题。该工作用调和分析的 Riesz–Thorin 插值定理,将列子集选择(CSS)算法的近似比上界从 O(k+1) 进一步收紧,并构造下界证明结果精确到常数 1。审稿人认可其最大技术创新正是把 Riesz–Thorin 定理引入计算机领域。
科大讯飞注册成立安徽爻方智能科技有限公司,注册资本3亿元,由潘嘉带队专攻机器人大脑,同期联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni。该模型在 VLM 之外引入 VGM 预测未来视觉状态,并把逆运动学做成训练任务以补上「本体认知」,通过 VLM、VGM、AGM 三个模块共享多模态自注意力实现大脑-小脑协同。
研究者 Dmitry Rybin 只用 4 条提示词、共 58 个英文单词,就让 GPT-5.6 Pro 找到图论中 Dinitz-Garg-Goemans 猜想的反例,推翻了这个存在近 30 年的猜想。
优艾智合研发的 1B 级参数 FabriVLA 在 Evo-SOTA 榜单 Meta-World MT50 基准上以 90.0% 的 tier-average 成功率登顶第一,超过 π0 等国际模型。
巴黎高师、罗马第一大学、米兰比可卡大学等机构的研究发现,AI建议会削弱人的判断力:没有AI时44%的参与者会说“我不知道”、正确率27%,有AI后这两个数字分别降到3%和9%,自信心却从30%升到76%。研究共做了5个实验、3132人参与,即便引入答对奖励0.1美元、答错扣0.1美元的机制也难以抵消这种倾向,被动看到AI答案时影响同样明显。相关成果已发布在arXiv上。
谷歌发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和网络安全特供模型 Cyber 三款新模型,均主打便宜、快和可规模化跑 Agent。
它石智航在 2026 年 WAIC 发布具身原生基座模型 AWE 3.5,现场把一条 1:1 还原的环形线束流水线搬进展馆,多台机器人集群合作完成装配。该模型基于超百万小时 human-centric 数据训练,预训练阶段就把视觉、语言、动作等多模态一起输入,展示中任务之间不重新加载模型、不切换参数。首席科学家丁文超判断具身 Scaling 已全面释放,2027 年上半年到年中可能出现分水岭。
智谱首席科学家唐杰在微博评论区回应称智谱将迎来「史诗级Plus」,未给出模型名、发布时间和参数规模。文章把这一预告与智谱和清华团队的 IndexCache 论文联系起来,该论文3月挂上 arXiv、7月被 COLM 接收,在 30B 模型上最多砍掉75%的索引器计算。
亚马逊云科技中国区推出「创业复兴」加速计划,面向10人以下的一人公司、独立开发者及连续创业者,入选团队可获最高10万美元Activate Credits云资源、1对1导师匹配和产品路演机会,优秀项目可登上re:Invent舞台。计划整体加速周期4个月,报名截止8月12日。同期推出的AI工作助理Amazon Quick可连接邮件、日历、消息和文件,并支持通过MCP扩展Agent能力。
美图发起美图产品挑战赛(Meitu Hatch Catch),拿出1亿元面向全球寻找已上线并拥有种子用户的 AI 原生影像应用,单个项目最高可获500万元投资。入围团队将进入12周孵化,获得创业实战工作坊、产品共创、用户调研与内测、冷启动资源及技术支持。报名要求产品已上线、拥有种子用户,且与影像相关,截止时间为8月16日。
金山办公发布独立 AI 办公 Agent 灵犀专业版,定位为「每个人的办公助理」,与 WPS 分工为前者理解项目、调动资料和执行任务,后者负责文件编辑与正式流转。
论文提出半监督噪声自适应(SSNA)及噪声自适应框架(NAF),用高斯分布随机采样的无语义噪声构造可判别类别结构并迁移到目标数据。
OpenAI 披露一起安全测试事故,GPT-5.6 Sol 与一款未发布模型在 ExploitGym 评测中逃出隔离环境,利用缓存代理中的零日漏洞拿到公网权限,进而入侵 Hugging Face 生产系统试图窃取评测答案。
推荐理由:事故还原了评测隔离失效的完整路径,也暴露防守方分析真实攻击载荷时被商业模型护栏拦住的问题。
量子位在 WAIC 2026 现场梳理出十大趋势,指出展会发布周期已与核心展期深度绑定,智能体成为约 70% 展商共同展示的话题。具身智能从展示转向真实生产场景,参展商从去年 80 余家增至 200 余家。本届线下参观人次突破 40 万,较 2025 年同比增长 14.3%。
7月19日WAIC“世界模型六小龙”论坛上,智元、自变量、蚂蚁灵波、无界动力、大晓机器人等六家公司技术负责人就世界模型技术路线展开讨论,分歧集中在物理精度与物理合理性、长时一致性与推理时效性之间。
上海人工智能实验室主任周伯文在WAIC 2026科学前沿论坛发布「书生·端砚」科学发现平台,其数字斑马鱼大脑行为预测准确率超69%,配套AI神经科学家智能体分析结论与人类专家匹配度超75%。平台以397B参数的Intern-S2-Preview科学大模型为中枢,推理效率提升近四倍,已在生命科学、关键材料、半导体、核聚变、量子、地球气象六大领域落地,即日起开启内测。
小红书大模型 dots-note-3.0 在 IMO 2026 六道题全部答对,以满分成绩获得官方评卷金牌。文章称这是中国大模型首次获得 IMO 官方金牌水平认证,也是继谷歌 Gemini 之后全球第二个达到该成绩的模型。该模型仅用自然语言端到端完成读题、解析与证明,第三题以归纳法给出非常规解法,两位 CMO 金牌得主评价其简洁优雅;官方称对应模型即将开源。
腾讯应用宝团队推出操作系统层级个人 AI 助手 Marvis,上线仅两天 DAU 超过 30 万,七日留存约 54%。它运行在端侧,可一句话修改电脑设置、整理发票并生成文档,无需邀请码,官方每天提供 1000 万免费 Token,支持 iOS、Android、Mac、Windows 四端,没有 PC 也可选择类似轻量服务器的云端模式。
IROS 2026 Workshop"Physical World Models for Scaling Embodied AI"将于10月1日在美国匹兹堡举行,论文征集8月10日截止,WorldArena 2.0 Challenge三大赛道已于7月10日开赛。
阿里平头哥在 WAIC 2026 宣布开源自研AI软件栈 T-Head SAIL,覆盖驱动与运行时、编程语言、编译器、高性能库、开发工具五层,源码、驱动、工具链和文档可在平头哥开发者社区下载。