和 5 位 Agent 一线实战者聊聊,企业 Agent 落地的关键问题
2026 年 80% 的企业应用已内嵌至少一个 agent,但仅 31% 真正在生产环境运行。Founder Park 联合百道数据、科锐国际将在 WAIC 期间举办「Builders' Night Talk」,邀请 5 位一线实战嘉宾,从内容智能、AI 员工、HR 场景、云与数据底座等方向探讨企业 Agent 落地中的数据打通、权限管理、效果验收与商业模式等关键问题。
按公众号阅读文章与观点
2026 年 80% 的企业应用已内嵌至少一个 agent,但仅 31% 真正在生产环境运行。Founder Park 联合百道数据、科锐国际将在 WAIC 期间举办「Builders' Night Talk」,邀请 5 位一线实战嘉宾,从内容智能、AI 员工、HR 场景、云与数据底座等方向探讨企业 Agent 落地中的数据打通、权限管理、效果验收与商业模式等关键问题。
AI科技评论对 MiniMax M3 进行实测,这款 MiniMax 旗舰模型重点强化 Coding 与 Agent 能力,配备 1M token 上下文和 MSA 稀疏注意力架构,官方价格为输入 0.6 美元、输出 2.4 美元每百万 Token。
谷歌上线轻量文生图模型 Nano Banana 2 Lite(官方调用名 gemini-3.1-flash-lite-image),已登陆 Google AI Studio、Gemini API 和 Gemini 企业代理平台,1K 图单张成本 0.034 美元、平均约 4 秒生成。
高德行中智能部提出 GrowLoop,通过少量人类种子标注驱动大模型反思,把说不清的感性标准转化为可自动学习的评分细则,并让细则与测试题目互相驱动生长。在 132 条题目、355 对配对判断上,GrowLoop 在最严格的三选一匹配指标上拿到 0.78,第二名 ICAI 为 0.58。论文已发表在 arXiv,后续将逐步开源。
AFAC2026 金融智能创新大赛开赛,设置交易行为识别、保险 PDF 转 Markdown、稀疏反馈下自动化实验设计、金融长文本精准问答四道赛题,全部来自真实金融场景。
英伟达开源自家的机器人技能库 ASPIRE,它让机器人通过写代码、看多模态执行轨迹、修程序,把一次次失败与修复沉淀成可复用的 Skill。论文在 LIBERO-Pro、Robosuite 和 BEHAVIOR-1K 三个基准上测试,其中 Robosuite 双臂物体交接任务的成功率从 20% 提升到 92%。
Cloudflare CEO Matthew Prince 在播客访谈中表示,2026 年上半年 Bot 流量首次超过人类流量,若趋势延续,五年内互联网流量可能达到今天的 1000 倍。他预计未来两年类似 Log4j 级别的漏洞可能每周出现一次,但随后 AI 审查会让软件质量大幅提升。Cloudflare 已裁减超过 20% 团队成员以压缩中层管理者,并正推动以微支付支撑未来互联网商业模式的方案。
脸谱心智(FaceMind Research Asia)的循环世界模型论文 LoopWM 登上 Hugging Face Papers 当日 Top1,该论文最早将 Loop 循环概念从 Agent 工作流推进到世界模型本体。
一篇被 IEEE Transactions on Software Engineering 接收的论文评测了 GPT-4o、o3-mini、Qwen 2.5 Coder、Qwen 3 等模型在 MoonBit 和 Gleam 上的代码生成能力,发现无资源语言 pass@1 仅 0% 到 1%,失败多源于语法错误。
OceanBase 正式发布湖库一体的 AI 数据库 Lakebase,将实时事务能力与湖上开放存储、开放计算放进同一数据底座。其底层采用存算分离架构,数据存于对象存储,计算层可独立伸缩至零;上层通过多模表统一结构化、半结构化、非结构化及多模态数据,并支持 SQL、Spark ETL 与 Daft on Ray 计算。
Fable 5 将于美国时间 7 月 1 日恢复全球上线,可在 Claude 平台、Claude Code 等处使用。Pro、Max 和 Team 用户 7 月 7 日前 Fable 用量计入每周限额最多 50%,之后需单独扣积分;AWS、微软和谷歌云接入尚未恢复,且安全分类器阈值更大,拒绝概率可能比开放初期更高。
Anthropic 的 Fable 5 在出口管制解除后恢复全球访问,7 月 1 日恢复上线后,Pro、Max、Team 和高级版 Enterprise 每周使用限额的 50% 可用于 Fable 5,7 月 7 日后改为按 usage credits 计费,标准 Enterprise 席位没有免费额度。
推荐理由:文章结合官方公告梳理 Fable 5 解除出口管制的协议条件、越狱分级框架与计费变化,呈现前沿模型与监管协作的落地细节。
硅基流动已向港交所提交上市申请,此前完成7轮融资,估值77.4亿元。招股书显示其2025年收入5533.0万元,同比增长653.2%,但年内亏损3.45亿元,毛利率从2024年的39.4%转为-24.0%,其中公有云服务毛利率为-119.0%。截至2026年4月30日,平台注册用户达1028.24万,累计支持超170个模型,服务超13000家企业客户。
Etched 宣布其 Transformer 专用芯片 A0 版已从台积电 N4P 工艺流片回片,并推出首款机柜产品,同时完成 8 亿美元融资、签下 10 亿美元客户大单。
Cognition为AI编程Agent Devin提出以ROI而非token消耗衡量价值,并推出Productivity Guarantee:若Devin创造的工程价值低于客户付费,将返还最高1000万美元额度的使用credits。
飞书发布多维表格智能体,让 AI 以团队成员的身份出现在消息列表里,能读取业务表格、在权限范围内写回状态并主动提醒风险。作者实测将其导入含 1398 条记录的生成式 AI 服务备案清单,智能体为 2026 年 4 月这批 72 条记录新增并标注了行业分类字段。
Anthropic 发布 Claude Sonnet 5,官方称其在推理、工具调用和编程上相比 Sonnet 4.6 明显提升,整体能力接近 Opus 4.8 但价格更低。
推荐理由:文章对比了 Sonnet 5 与 Opus 4.8 的定价,并提示新 tokenizer 可能增加 token 消耗,便于读者评估迁移成本。
面向 AI Agent 建站场景的域名注册教程,以腾讯云为例演示购买流程,并提示域名下的【轻量应用服务器】【DNS解析】【SSL证书】均无需勾选。域名可用于 Workbuddy 的 EdgeOne Pages、Vercel、GitHub Pages、Cloudflare Pages 等平台的自定义域名映射,购买后主要与 DNS 打交道,后续网站项目都需通过 DNS 映射到自有域名。
清华大学自动化系副教授封硕创立幂级智能(Dense AI),目标是在物理AI领域打造订阅制的世界基础模型,公司成立于2026年1月。其模型DenseWorld计划从V1.0(10K小时数据,1B参数)演进至V4.0(100M小时数据,1T参数),为机器人、无人车、无人机提供测试、训练与大脑服务。封硕2023年以第一作者在Nature正刊发表自动驾驶汽车安全性测试论文,提出稀疏度灾难概念。
Anthropic 发布 Claude Sonnet 5,成为网页版默认模型,今天起全平台可用,Claude Code 和 API 中使用 claude-sonnet-5 这一名称。
Anthropic 被曝在系统提示中以用户无法察觉的方式植入市区代理和 AI 实验室信息以获取用户信息,被发现后称该方式本就准备下掉。昨晚发布的 Sonnet 5 测试结果接近 Opus 4.8,但任务成本可能比 Opus 4.8 还高,甚至接近 Fable 5,用户反馈其会偷懒、拒绝执行任务。Fable 5 模型已被授权重新开放给所有用户。
Cursor 发布名为 Cursor Mobile 的 iOS 移动应用,用户可在手机上启动编码会话、查看智能体输出并实时交互,还支持语音输入与斜杠命令。
Anthropic 突然发布 Claude Sonnet 5,官方称这是迄今最具智能体能力的 Sonnet 模型,重点提升计划制定、工具调用与自主执行,已面向所有套餐开放并成为 Free 和 Pro 用户的默认模型,同时上线 Claude Code 和 Claude Platform。
推荐理由:文章把 Sonnet 5 的发布放在 Anthropic 高端模型受出口管制、社区反馈平淡的背景下,梳理其性价比定位与争议。
腾讯混元与 UNSW 在 ACL 2026 论文中系统研究了大语言模型 SFT 的「不完全学习」(ILP),提出「检测→归因→干预→验证」框架,并归纳出五大根因与五种干预方案。论文承认约 3% 的未学习样本无法归入现有根因,并展望了自由文本 pass@N 检测、多根因联合归因、CPT 精细化及向 RLHF/DPO、多模态、持续学习推广等方向。
谷歌通过 Gemini API 和 Google AI Studio 正式开放视频生成模型 Gemini Omni Flash,同时发布图像模型 Nano Banana 2 Lite。
Anthropic 发布性价比模型 Sonnet 5,主打 Agentic 能力,agentic coding 跑分 SWE-bench Pro 达 63.2%,标价与 Sonnet 4.6 一致,约为 Opus 4.8 的六成。开发者实测发现,新分词器让同一段英文的 Token 数增加 42%,在 Artificial Analysis 任务上的实际花费反比 Opus 4.8 高出 27%。
推荐理由:原文用实测对比展示标价不变背后的Token消耗变化,帮助开发者估算迁移到 Sonnet 5 的真实成本。
OpenAI 工程师向部分同事透露,依托几项全新优化技术,可将模型推理成本削减一半以上,应用于无账号访客使用 ChatGPT 的场景后,所需英伟达 GPU 一度压至仅数百块。
00后团队逆矩阵正完成新一轮超亿美元融资,估值超50亿元人民币,创始人陈博远今年刚毕业于北大元培,并已兼任智源研究院行为世界模型创新中心负责人。逆矩阵做的是通用世界基座模型Physis,陈博远在对话中提出世界模型可类比自动驾驶划分W0到W5,强调其核心是真正懂物理的W2+能力。
有开发者在 Reddit 逆向 Claude Code 后发现,Anthropic 通过读取本地时区以及 ANTHROPIC_BASE_URL 域名来识别中国大陆用户,并用隐写术把标记藏进系统提示词回传服务器。
Claude Sonnet 5 凌晨发布,百万 token 输入输出费用分别为 2 美元和 10 美元。作者指出这一价格约为 GLM-5.2 和 KIMI-K2.7-Code 的 3 倍,并称其为 A 社性价比最高的模型。
Anthropic 发布 Claude Sonnet 5,Agent 能力接近 Opus 4.8,即日起在免费版、Pro、Max、Team 和 Enterprise 套餐开放,API 代号 claude-sonnet-5,上线初期输入每百万 token 2 美元、输出 10 美元,优惠持续到 8 月 31 日。
推荐理由:Sonnet 5 把此前多在 Opus 系列出现的 Agent 能力下放到更低价位,读者可据此权衡模型选型与成本。
赛博禅心发布了一篇 ChatGPT 广告投放指南,数据主要来自 Nexad 报告,梳理了广告位形态、出价与定向方式。ChatGPT 广告出现在回答下方并带 Sponsored 标签,出价分 CPM 和 CPC,定向用 context hints 描述适用对话而无关键词字段。
作者宣布从明天起将写作重心转向国内 Agent,围绕 Workbuddy(Codebuddy)、Trae、Qoder、KIMI Work 等制作系列教程,改为每篇聚焦一个小专题的短平快形式。
AI 数据中心对 HBM 的需求挤占消费级内存产能,2026 年一季度 DRAM 合约价单季上涨接近 90%,内存涨价推高手机和 PC 售价,500 美元以下低端笔记本面临消失风险。文章指出数据中心扩张同时推高电价,而前沿模型又受算力与安全审查限制,普通人分摊了成本却难以接近最强能力。
云天畅想6月17日宣布完成超10亿元人民币E轮融资,由中国互联网投资基金领投,累计融资超30亿元,公司定位从边缘智算服务商拓展为面向AGI时代的“实时智算织网”。其押注的是实时语音交互、AI PC、智能座舱等对低时延敏感的“实时Token”场景,试图避开普通Token价格战,但低时延能否形成持续溢价仍需客户付费验证。
美团正式发布 LongCat-2.0,1.6 万亿参数的 MoE 模型,全流程在 5 万张国产算力卡上完成训练和推理,上下文为 100 万。同一天寒武纪涨近 8%,总市值突破 1 万亿人民币。作者实测其纯 Agent 和 Coding 能力大致在 Claude Opus 4.6 水平。
6月29日,三星集团与SK集团联合宣布将在未来十多年累计投资4755万亿韩元(约合人民币20.95万亿元),重点投入半导体、机器人和AI数据中心等领域。其中三星承担2655万亿韩元,布局HBM、机器人、先进显示和下一代电池;SK投资2100万亿韩元,由SK海力士扩充AI存储芯片产能,同时建设大规模AI数据中心。
AI科技评论以 Claude Code 作为 Agent 执行环境,用修 Bug、生成 3D 游戏、重构 Flask 项目三项工程任务实测了月之暗面的 Kimi K2.7 Code。
美团 Keemart 前后端团队正式合并、蚂蚁网商推动测试岗整体转向研发,AI Coding 正在推动大厂把前后端分工并入全栈交付。字节、阿里、谷歌、腾讯等招聘岗位描述显示,前端岗位职责已扩展到 Agent 服务编排、模型调用与端到端交付。
6 月谷歌 DeepMind 多位核心研究人员流向 OpenAI 和 Anthropic:Gemini 共同负责人 Noam Shazeer 于 6 月 18 日宣布加入 OpenAI。