RSS 2026 悉尼 Social Mixer 晚宴报名中:量子位等联合举办
第22届RSS 2026将于7月13-17日在澳大利亚悉尼举办,量子位、源策未来与OpenDriveLab于7月14日晚19:00在W Sydney联合举办Social Mixer线下聚会,采用申请制报名,审核通过后发放入场通知。
微信公众号
第22届RSS 2026将于7月13-17日在澳大利亚悉尼举办,量子位、源策未来与OpenDriveLab于7月14日晚19:00在W Sydney联合举办Social Mixer线下聚会,采用申请制报名,审核通过后发放入场通知。
AFAC2026 金融智能创新大赛开赛,设置交易行为识别、保险 PDF 转 Markdown、稀疏反馈下自动化实验设计、金融长文本精准问答四道赛题,全部来自真实金融场景。
英伟达开源自家的机器人技能库 ASPIRE,它让机器人通过写代码、看多模态执行轨迹、修程序,把一次次失败与修复沉淀成可复用的 Skill。论文在 LIBERO-Pro、Robosuite 和 BEHAVIOR-1K 三个基准上测试,其中 Robosuite 双臂物体交接任务的成功率从 20% 提升到 92%。
脸谱心智(FaceMind Research Asia)的循环世界模型论文 LoopWM 登上 Hugging Face Papers 当日 Top1,该论文最早将 Loop 循环概念从 Agent 工作流推进到世界模型本体。
一篇被 IEEE Transactions on Software Engineering 接收的论文评测了 GPT-4o、o3-mini、Qwen 2.5 Coder、Qwen 3 等模型在 MoonBit 和 Gleam 上的代码生成能力,发现无资源语言 pass@1 仅 0% 到 1%,失败多源于语法错误。
OceanBase 正式发布湖库一体的 AI 数据库 Lakebase,将实时事务能力与湖上开放存储、开放计算放进同一数据底座。其底层采用存算分离架构,数据存于对象存储,计算层可独立伸缩至零;上层通过多模表统一结构化、半结构化、非结构化及多模态数据,并支持 SQL、Spark ETL 与 Daft on Ray 计算。
硅基流动已向港交所提交上市申请,此前完成7轮融资,估值77.4亿元。招股书显示其2025年收入5533.0万元,同比增长653.2%,但年内亏损3.45亿元,毛利率从2024年的39.4%转为-24.0%,其中公有云服务毛利率为-119.0%。截至2026年4月30日,平台注册用户达1028.24万,累计支持超170个模型,服务超13000家企业客户。
Etched 宣布其 Transformer 专用芯片 A0 版已从台积电 N4P 工艺流片回片,并推出首款机柜产品,同时完成 8 亿美元融资、签下 10 亿美元客户大单。
谷歌通过 Gemini API 和 Google AI Studio 正式开放视频生成模型 Gemini Omni Flash,同时发布图像模型 Nano Banana 2 Lite。
Anthropic 发布性价比模型 Sonnet 5,主打 Agentic 能力,agentic coding 跑分 SWE-bench Pro 达 63.2%,标价与 Sonnet 4.6 一致,约为 Opus 4.8 的六成。开发者实测发现,新分词器让同一段英文的 Token 数增加 42%,在 Artificial Analysis 任务上的实际花费反比 Opus 4.8 高出 27%。
推荐理由:原文用实测对比展示标价不变背后的Token消耗变化,帮助开发者估算迁移到 Sonnet 5 的真实成本。
Claude Code 负责人 Boris Cherny 提出一套 AI 时代的职场 MBTI,认为研发、产品、设计、数据科学家等传统职能会被原型师、建造师、清道夫、增长手和维护者五类角色取代。他按产品阶段给出组队思路,产品刚起步需要原型师、建造师和清道夫,已有强 PMF 时则以清道夫、增长手和维护者为主。他称 AI 压缩了技能之间的鸿沟,当下是通才的黄金时代。
乐动机器人登陆港交所主板,押注物理AI感知基础设施,自研 LD-SenseWorld 灵境物理空间交互大模型,将多源传感器数据加工为空间Token。2025年其核心产品DTOF激光雷达出货量超400万台,搭载其视觉感知技术的设备量突破2000万台。
17名美国消费者和小企业主在加州联邦法院对三星、SK海力士和美光提起集体诉讼,指控三家以转产高带宽内存(HBM)为掩护,协同削减消费端DDR3、DDR4产能并抬高价格。诉状称四年内DRAM价格上涨约700%,而三家企业合计占全球DRAM市场约90%。知名分析师郭明錤预计内存供需缺口仍在扩大,至少要等到2027年以后才可能出现转机。
推荐理由:诉讼指控与二十年前那场DRAM价格操纵案高度相似,可借此理解产能转向HBM如何推高消费端内存价格。
虎牙推出基于 DiT 架构的实时多模态数字人基础模型 VAM 1.0(Vivid Avatar Model),只需一张照片即可生成能实时对话、唱歌跳舞的 AI 数字人。该模型支持 480×832 分辨率、28 帧实时流式输出,可连续运行 24 小时以上,在 8 块 H200 GPU 集群上达到 36.4 帧每秒推理速度,首帧延迟约 1.3 秒,每片段延迟 0.77 秒。
DeepSeek 向开发者发邮件通知,V4 正式版将于 7 月上线,同时高峰时段 API 的输入 token(缓存命中、缓存未命中)和输出 token 价格全部翻倍。
明略科技开源发布Octo,定位为开源可信的Agent协作网络,让Agent以Bot身份进入团队协作,实现Agents do、Humans decide。Octo引入Bot、Channel/Thread、Matter三个核心概念,并给出Solo、Roundtable、Critic、Pipeline、Split、Swarm六种协作模式。
阶跃星辰参与发表 JetSpec 论文,用因果并行树生成提升投机解码的接受长度,在 Qwen3-8B 上相比标准自回归解码最高实现 9.64× 端到端解码加速,MATH-500 上一次验证平均接受 10.76 个 token。
智谱唐杰公开征集下个版本 GLM 的需求,浏览量超 40 万,评论区呼声最高的是视觉能力。此前开源的 GLM-5.2 在 AI 编程上位列开源第一、全球第二,但作为纯文本模型未搭载视觉编码器,而智谱 4 月已发布原生多模态的 GLM-5V-Turbo。
智谱发起人、首席科学家唐杰提出AI时代企业竞争力排序为"认知>格局>技术>管理",认为管理的重要性正被AI压扁的组织结构削弱。他指出AI技术进步密度空前,预训练infra、Agentic RL、self-judge、fully self training等新范式几天内即可刷屏全球,技术落后是一夜之间的事。
无界动力发布全球首个"长时序双向物理因果链"隐空间世界模型 MWA,在 RoboCasa GR1 TableTop 榜单以 75.2% 平均任务成功率拿下全球第一,超过英伟达 GR00T-N1.6。
美光在6月25日财报发布后股价单日跳涨18.4%,盘中一度冲到1236美元,市值约1.4万亿美元,首次反超Meta并逼近特斯拉。该季营收414.6亿美元、同比暴涨346%,毛利率85%;这轮上涨源于AI数据中心推高HBM和DRAM需求,据TrendForce,2026年一季度传统DRAM合约价环比上涨90%-95%,CEO称中期只能满足客户50%到三分之二的需求。
推荐理由:从内存涨价切入,梳理美光被华尔街重新定价为AI基建瓶颈股的逻辑,并点出周期反转的潜在风险。
普林斯顿大学推出 CEO-Bench,让 14 个 AI 模型在 100 万美元本金下运营虚拟 SaaS 初创公司 500 天,最终仅 4 个保住本金。
自变量连续完成4轮融资,投后估值突破200亿元,融资款全部到账并完成交割,成为大湾区首家估值超200亿元的具身大脑公司。自4月下旬宣布小米战投领投的B轮后两个多月,公司又完成B+、B++和C轮融资,已确认投资机构超过30家,小米战投连续三轮加注。自变量称机构看好的是具身大脑方向,公司已发布基于世界统一模型架构的具身大模型WALL-B。
Semgrep 的测评显示,智谱 GLM-5.2 在没有脚手架加持、只给一个 prompt 和一堆代码裸跑的情况下,IDOR 漏洞检测拿到 39% 的 F1 分,超过同样裸跑的其他开源模型,也超过搭载 Opus 4.8 的 Claude Code(32%)。
Agnes AI 推出 PC 端 AI 图片、视频与短剧创作平台 Pavo,称其为首款不限时、免费可用的视频、短剧、图片创作平台。Pavo 把短剧创作拆成含 Agent、图片生成、视频生成和剧情短片四个模块的工作流,支持素材快速引用、智能模型路由和 Harness 调度,可针对单个分镜做局部返工。
DeepSeek 启动 74 亿美元融资,梁文锋自己出资 200 亿人民币(约 30 亿美元),占总额的五分之二。The Information 消息称,直接导火索是梁文锋看到 Claude Mythos 通过海量算力和数据训练出的超强能力,意识到 DeepSeek 必须储备弹药。
DeepSeek 新论文 DSpark 提出将并行与串行草稿生成结合的推测解码方案,单用户速度提升 85%、高并发有效吞吐翻 4 倍,均以 DeepSeek-V3 的 MTP-1 为基线。
GitHub 上拥有 2 万 Star 的开源项目 ai-website-cloner-template 提供 /clone-website 命令,输入一个 URL 即可像素级克隆站点,输出可直接本地运行的 Next.js 工程。
光本位科技与东方天算联合启动全球首颗天基光计算卫星和全球首个天基光计算载荷研制,所用光电融合计算卡单卡算力达300 TOPS,支持INT8、FP8多精度推理,已开展在轨环境试验验证。
个人开发者逯雨鑫(yuxinlu1)把 Fable 5 的编程推理能力蒸馏进 Gemma4-12B,发布 V1 Coder 版和 V2 agentic 版两个 GGUF 本地模型,一度登上 Hugging Face Trending 榜首。
南大王利民团队与腾讯混元提出 HYDRA 系列,用一个基于 ViT 的统一视觉 Tokenizer 同时承担原生多模态模型的理解与生成编码,替代此前分设语义 encoder 与重建 encoder 的做法。
Einsia AI 旗下 Navers Lab 发布开源项目 BrowserBC,通过录制、转写成自然语言 Skill、交付执行三步,把人类浏览器操作轨迹蒸馏为可被其他模型复用的技能。
vivo AI Lab 联合之江实验室、中国科学院大学杭州高等研究院提出半在线强化学习框架 SOLAR-RL,以 Qwen2.5-VL-7B-Instruct 为基座、仅用 15k 条静态轨迹训练,在 AndroidWorld 上取得 33.7%SR,超过使用 145k 轨迹的在线方法 UI-TARS-7B-SFT(33.3%)。
杭州团队 Om AI 发布全球首个面向物理世界的端侧流式多模态模型系列 VLX,三天连发 Flow、Seek、Go 三款模型,共享同一基座并在同一条视频流上完成感知、定位与行动的端到端协作。
至知创新研究院(IQuest Research)联合中国人民大学、KAUST 提出 FORT,一个面向 Deep Search Agent 的抗捷径训练数据合成框架,并基于 Qwen3-30B-A3B-Thinking-2507 仅用 SFT 训练出 FORT-Searcher。
微软发布一年一度的《Work Trend Index》报告,基于全球10个市场20000名AI使用者和数万亿条Microsoft 365生产力信号,指出组织环境对AI真实价值的影响占67%,个人心态与行为仅占32%,前者约为后者的两倍。
清华大学自动化系团队提出 UDS(Utility-Diversity Sampling),一个面向大语言模型 SFT 的在线 batch 选择框架,利用前向传播已有的 logits 同时评估样本效用与多样性,无需验证集、参考模型或额外反向传播。
OpenAI 发布 GPT-5.6 系列三款模型,旗舰 Sol、日常主力 Terra 与高速低成本 Luna,按每百万 token 计价,输入分别为 5、2.5、1 美元,输出为 30、15、6 美元。
Anthropic 前员工创办的自进化 AI 公司 Mirendil 完成 2 亿美元种子轮融资,a16z 和凯鹏华盈领投、NVIDIA 跟投,最新估值 10 亿美元。
谷歌 DeepMind 推理团队创建者周登勇(Denny Zhou)已加入 Meta,在 MSL 担任研究科学家,LinkedIn 信息显示他已在 Meta 工作约四个月。