实测飞猪「飞猪帮帮」:旅行 AI Agent 能否打通交互到交易?
飞猪升级消费级 AI 能力并推出旅行智能助理「飞猪帮帮」,可在行前、行中、行后调用平台商品、订单和服务体系办事,而非只做问答与行程规划。飞猪数据显示,其交付结果可用率评分较上一代产品「问一问」提升超 70%,可比任务平均耗时减少近 10%,目前仍为以周为单位迭代的中间态版本。
微信公众号
飞猪升级消费级 AI 能力并推出旅行智能助理「飞猪帮帮」,可在行前、行中、行后调用平台商品、订单和服务体系办事,而非只做问答与行程规划。飞猪数据显示,其交付结果可用率评分较上一代产品「问一问」提升超 70%,可比任务平均耗时减少近 10%,目前仍为以周为单位迭代的中间态版本。
国立清华大学与 NVIDIA 提出 VLM-AR3L 框架,让 Gemini 2.0、GPT-4.1 等 VLM 在《我的世界》等 10 项具身任务中充当视觉裁判。
苏黎世联邦理工学院博士后秦浩桐在 IJCAI 2026 演讲中提出 BiLLM 与 SqueezeLLM 两项后训练量化工作,无需重新训练即可将 LLM 压缩至 1 比特与 2 比特。
8 月 17 日,DeepSeek V4 Pro API 调整价格,最便宜的缓存命中价格在空闲时段涨了 5 倍,高峰时期涨了 11 倍,从 0.025 元/百万 Token 涨至 0.3 元/百万 Token。
浙江大学与西湖大学联合培养博士生丁鹏翔成立「共生知行(symbiosis-robotics)」,聚焦具身智能端到端动作生成,试图解决大模型"理解任务但动作执行不可靠"的结构性问题。其路径名为"直接感知控制",主张模型感知机器人本体物理状态并直接输出动作指令,省去轨迹跟踪环节,使感知到执行形成端到端闭环。丁鹏翔师从王东林教授,其VLA-Adapter模型在GitHub获超2300个Star。
Manifold AI(流形空间)创始人武伟在访谈中表示,公司押注隐空间世界模型路线,已发布 RoboScape、WorldScape 与 WorldScape Policy,其 WorldScape 于 2026 年 4 月在 WorldScore 榜单总分居首。
RoboScience 机器科学发布首款轮式仿人形通用操作机器人 REX G1,搭载自研 VLOA 架构通用具身大模型 Visics,面向物流、工厂、零售及家庭场景。
拉格朗日具身技术自研 Agentic OS,为 Agent 提供环境状态感知、机器人技能调度、安全边界约束与人工接管机制,让任务以结果验证而非指令下发为终点。其采用分层智能架构:高层 Agent Harness 组织通用模型与 Coding Agent,现场 Agentic Runtime 负责任务编排与异常恢复,设备侧专用模型守住精度与安全。
AI科技评论把一张破碎陶罐截图和分镜文字交给本地部署的 MiniMax H3,测试它能否反向生成陶罐破裂的完整过程,并与 Seedance 2.0 Fast 做同题对比。
前 OpenAI 首席产品官 Kevin Weil 正为其新公司募资 1.5 亿美元,估值达 7.5 亿美元,公司尚未公开名称,定位是"为 AI 模型收集科学数据"的平台。
DeepSeek 于 8 月 13 日开放 DeepSeek Harness v0.1 Developer Preview,截至 8 月 14 日下午在 GitHub 已获 4.5 万星。
IJCAI 2026 在德国不来梅召开,Agent、Multi-agent、Robotics、Reinforcement Learning 成为议程重点。阿里 Qwen-CUA 推进 Computer Use,Qwen DianJin 的 Fin-PRM 被大会接收;字节 Seed 的 GUI-ReWalk 探索大规模生成 GUI Agent 训练轨迹。
章鱼动力将在世界机器人大会(WRC)首日发布全栈自研绳驱高自由度仿生灵巧手 OctoH-Hand,集成28个独立可控执行器、23个主动自由度和超1900个触觉传感单元,阵列间距≤1mm。
自变量机器人在8月12日的全网直播中完成一小时随机快递包裹分拣挑战,有效分拣1816件,综合成功率98%,约两秒一件。这套双臂机器人只配标准工业夹爪,未用灵巧手,速度比 Figure AI 公布的1248件/小时高45%,成本整体下降70%,搭载的是自研 WALL-B 具身智能大模型。合伙人兼算法一号位甘如饴在直播问答中表示,意图推理层面的泛化仍是长期目标。
澳大利亚昆士兰大学教授潘世瑞在 IJCAI 2026 有四篇论文入选,研究围绕图结构数据在标签缺失、分布偏移、隐私约束等真实缺陷下的学习方法。四篇工作分别为无监督图欺诈检测框架 CAMERA、联邦图级异常检测方法 FedCIGAR、事件感知的时间序列预测模型 EventTSF,以及用测试时计算扩展做蛋白质设计的 TTS-Design。
清华大学自动化系与腾讯混元提出 Listwise Policy Optimization(LPO),把 group-based RLVR 显式建模为 LLM Response Simplex 上的目标投影,并拆分为目标分布与投影方式两步。
求之科技世界模型负责人韩磊认为,具身智能行业对世界模型的定义之争只是话术,真正核心是模型有没有泛化能力。他负责的 S2 层世界模型通过隐空间像素轨迹预测和双目 3D 输入提升 OOD 泛化,公司自研仿真器 DISCOVERSE 2.0 基于 3DGS,可支撑上万 FPS 并发渲染。端侧现用英伟达 Orin,后续计划切换地平线征程 6。
具身大脑公司原力无限(INFIFORCE)近期完成A轮及A+轮融资,金额近10亿元,由敦鸿资产及头部国资平台领投,浙大科创集团、盐都国控、丽水市国资公司等跟投,资金将用于AtomBrain因果世界模型、全栈AI Infra DataGrid研发以及多形态机器人本体在真实场景的规模化交付与验证。
WorkBuddy 升级资料库功能,普通用户无需写代码即可用自然语言生成、编辑和发布 HTML 页面,并支持多人多 Agent 协同修改。页面可挂载 CSV 数据实现增删改实时同步,Markdown 则作为内容底稿与 HTML 分工协作。官方将其概括为“CSV、Markdown 给机器,HTML 给人”。
网传 DeepSeek Harness 内测入选名单显示,70% 入选项目为几乎零热度的个人或小团队新作,高星项目反而落选,筛选标准聚焦能否填补生态空白。已曝光的 17 个开源项目中,MCP 插件与 Coding Agent 占比最高,医疗、法律、金融等垂直应用不足 4%。DeepSeek 正从「最强 API」转向「工业级 Agent 生产线」,重点补齐执行层安全、工程可靠性与商业化 ROI。
Claude 近期被用户反馈体验跟不上模型升级:Sonnet 5 实际表现未达预期,Fable 5 定价更高却难与 Opus 5 拉开差距,且上下文仅用到约 20%–30% 能力就开始下滑。这些问题分别卡在生成机制、test-time compute、模型分层、长上下文状态一致性和 Agent 运行时五个环节,核心是长 Agent 任务中状态保真与错误回滚能力不足。
浙江大学陈静远教授课题组与斯旺西大学联合团队提出自适应非对称适配器,通过预测置信度自动抑制图像塔微调,在 11 个视觉数据集上超越 CoOp、MaPLe、MMRL 等 11 种方法。实验发现文本分支微调收益更高,而 OOD 场景下激进微调图像塔会严重破坏 CLIP 泛化力。该方法在单张 A800 GPU 上训练推理开销低于 MMRL,并兼容 ViT 与 ResNet-50。
浙江大学与清华大学团队提出 SkillTFM,首次将 Agent 领域的 Skill 技术引入表格基础模型,实现免训练适配。该系统通过证据提取、修复技能、门控策略与技能记忆四大模块,仅在证据充分时执行选择性修复,证据不足则保留基础模型预测。
研究人员发现,Claude、GPT 和 Gemini API 返回的加密 hidden reasoning 并未始终与原始模型和会话严格绑定,同厂商的其他模型可以读取并转录出可读的推理内容。
灵御智能凭高性能本体在“申智杯”具身智能比赛三个赛项全部夺冠,其灵御TA2机器人二次开发版已被多个模型开发团队预订。TA2支持远程控制与模型推理统一接口,π0、π0.5等开源模型已完成从数据采集到实机部署的闭环,并已在太原京东七鲜超市常态化运营。灵御智能2026年7月起单月量产100台并全部交付,在手订单金额超1亿元。
IJCAI 2026 收录 6 项中国团队具身智能成果,聚焦 VLA 泛化、触觉抓取与极端环境控制。李全义通过文本隐变量插值(TLI)在不重训模型的情况下,将 π₀ 在外推新任务 libero-ood 上的成功率从 9% 提升至 83%;中科大董二宝团队 PECHC 算法在无视觉参与下实现 150 个真实物体 97.3% 抓取成功率。
广东工业大学、汕头大学和清华大学团队提出 CDFM(Causal Discovery Foundation Model),一个面向异质、未知机制的通用零样本因果结构推断框架,先在多样化合成因果机制上预训练,再直接对新数据推断因果图。
前 Kimi CLI 负责人、Raft 创始人 stdrc 提出,模型越强 Harness 反而越厚,复杂度正从弥补模型能力的底层 Prompt 与工具封装,迁移到多智能体协作和跨会话状态管理等上层。
OpenAI 扩展网络安全计划 Daybreak,并推出专门面向网络安全场景的模型 GPT-5.6-Cyber,按防御向 Daybreak Blue 与攻击模拟向 Daybreak Red 划分。
Meta 发布约 30B 参数的多模态 Agent 模型 Muse Glimmer,支持 128K 上下文,采用 Apache 2.0 许可,并提供 llama.cpp、MLX、ExecuTorch 等本地部署方式。
BeingBeyond 智在无界发布 Being-H0.8,称其为全球首个隐式触觉世界动作模型,首次将触觉模态引入大规模模型预训练,并把视觉、触觉、动作与未来状态变化统一到同一隐空间。其隐空间世界动作模型路线训练成本约为视频生成路线的 1%,推理速度可支撑实时控制,团队已积累超 50 万小时第一视角人类视频数据。创始人卢宗青为北京大学计算机学院长聘副教授,认为具身基础模型的确定性技术尚未出现。
前华为「天才少年」、诺亚方舟实验室技术专家楼燚航离职创立具身智能公司引力蓝移,采用 System Two 与 System One 分层架构,System Two 参数规模可扩至 200B 以上。团队规划 6 至 12 个月推出 40B 至 80B 模型,24 个月左右形成小规模收入,第一阶段融资估值约 2 亿美元。
Anthropic 为 Claude Code 增加了实验性能力 Cross-session messaging,允许多个同时运行的 Session 互相发送消息。
揽月动力研发基于约化模型的物理 AI 架构 RACE,并推出首款重载双轮足人形机器人 L1,力控频率达 1000Hz、底层可支持 2000Hz,可负重 25kg 移动。L1 正在国内某龙头企业工厂进行 POC 验证,多家工厂已提出合计约 1000 台部署需求,公司同时与航天院所等机构探讨机器人参与太空基建的可能。
橡木果机器人近日完成数亿元人民币天使轮融资,由招商局创投、蔚来资本共同领投,水木清华校友基金跟投。该公司提出 Natus 与 Magis 双层模型架构,以视触觉感知为底座,让机器人先靠本能探索、在真实物理世界自生成数据并在线自学习,而非依赖纯数据驱动。其方案已进入全球头部 ODM 厂商产线并完成 POC 验证。
国内光计算创业公司奇算光启完成天使轮及天使加轮融资,自成立以来累计融资规模已达数亿元。天使轮由高瓴创投领投,BV 百度风投、张江高科跟投;天使加轮由高瓴创投、真格基金、上海未来产业基金联合领投,同创伟业跟投,老股东深流资本、张江高科与 BV 百度风投继续加注。
上海交通大学、上海创智学院与穹彻智能的两项工作 ChronoFlow-Policy 和 LaMP 即将发表于 ECCV 2026,二者都把三维运动流作为观测理解与动作预测之间的中介信号。
AI科技评论用 Qwen 3.8-Max 和 GPT-5.6 分别从零搭建同一个 3D 大模型演进网站并继续迭代,Qwen 3.8-Max 的页面完成度更高,但耗时和 Token 消耗明显更多。
当地时间 8 月 5 日,OpenAI 员工 Eric Wallace 和 Michael Dalton 在 Black Hat USA 2026 大会上首次公开还原 Hugging Face 入侵事件的完整时间线,确认事件源头是 OpenAI 内部正在运行的智能体安全评估任务。
推荐理由:OpenAI 还原的时间线展示了智能体如何借共享基础设施互传漏洞与凭据,并点出攻防自动化程度的差距。
CVPR 2026 上的 3DGS 研究全面转向工业落地,从秒级前馈生成、GPU 算子重构到抗噪 SLAM 建图与物理碰撞推算,打通“生产-运行-架构-应用”全管线。