普林斯顿、蚂蚁集团与斯坦福推出 AQuA:面向量化金融自主因子发现与模型开发的两部分智能体框架
普林斯顿大学、蚂蚁集团与斯坦福大学的研究者提出 AQuA,一个由语言模型驱动的两部分智能体研究框架,分别用于加密货币符号化 alpha 因子发现和美国股票时序模型开发,两部分不共享智能体、记忆与候选空间。
网站与博客 · 历史来源 · 当前未持续收录
普林斯顿大学、蚂蚁集团与斯坦福大学的研究者提出 AQuA,一个由语言模型驱动的两部分智能体研究框架,分别用于加密货币符号化 alpha 因子发现和美国股票时序模型开发,两部分不共享智能体、记忆与候选空间。
Gradium AI 发布新的文本转语音模型并设为 API 与 Studio 默认模型,在 500 句五语言硬案例集上取得 81.0% 人工评分通过率,超过 Cartesia Sonic 3.6 的 75.1% 和 ElevenLabs v3 Conversational 的 65.4%。
Keenable AI 开源了 NEEDLE,一个每小时重建查询集的实时搜索基准,覆盖新闻、金融、学术、长尾与法律五个垂直方向。基准让 15 个搜索 API 在相同查询文本和同一协议下运行,并把各家结果池化为 ultimate 上限,用于区分排序问题与整个市场共有的检索问题。
Google Research 发布 TimesFM-3,一个 330M 参数的时间序列基础模型,可在单次前向中同时预测多条相关序列。它原生按多变量预训练,训练数据超过 1 万亿个时间点,零样本即可接受多个预测目标、历史协变量和过去-未来协变量,无需针对任务做微调。
OpenClaw 团队发布 OpenClaw 2.0,重写安装流程与浏览器 Control UI,在模拟默认聊天测试中把启动时间从约 1.6 秒降到 575 ms。
语音智能体的自然对话需要 voice-to-voice 低于 1,500ms,折算到转录-LLM-语音链路中约等于 700ms 的 TTFT 预算。
Google Cloud AI Research 联合圣路易斯华盛顿大学和 UNC Chapel Hill 发布 EnvHarness,一个可编程层,通过 reset()/step() 接口包装已有的智能体环境,在不动模拟器、任务和人工验证器的前提下改变回合起点、动作空间和观测内容。
Anthropic 开放 Model Hardware Standard(MHS)研究预览,这是一套让 AI 智能体发现并操作物理设备的共享规范,据其团队说法可将设备对接从数周到数月缩短到数小时或数分钟。
MirroS 发布 Code-as-World,用智能体循环从真实视频中恢复可被 MuJoCo 执行的 scene.json 物理程序,并以 Apache 2.0 开源 Code-as-World-VL-4B 和 Code-as-World-VL-9B 两个 checkpoint。
教程演示如何用 NVIDIA Earth2Studio 搭建批量集合天气预报流程:加载 FCN 预报模型、从 GFS 获取初始场,并实现将 10 米风分量转换为风机容量系数的自定义风电诊断。流程以 8 个集合成员、2 的批大小和 8 个预报步长运行,通过 Zarr 存储输出,并用纬度加权 RMSE、公平 CRPS、集合离散度等指标对照 GFS 分析验证。
Google 发布 Gemini Omni 1.1 Flash(gemini-omni-1.1-flash),是其原生多模态视频生成与编辑模型的正式版本更新。
Hugging Face 旗下波尔多团队 Pollen Robotics 本周开启 25 厘米双足机器人 Microduck 的预购,售价 399 美元,走路、坐下、踢球、轮滑和跌倒后自行站起等动作都由物理仿真器中训练的神经网络策略导出到硬件。
Z.ai 发布 320B 参数、18B 激活参数的多模态 MoE 模型 GLM-5.3-Flash,阿里 Qwen 团队发布 125B 参数、6B 激活参数的 Qwen3.8-Flash-Next,两者在本周相隔一天开源。
推荐理由:文章逐层对比两份模型配置的相同选择与分歧,可据此了解开源模型架构正在收敛的方向。
Vercel AI 开源了 vgpu,一个把 .wgsl 文件当作可导入模块处理的 TypeScript WebGPU 库,采用 MIT 许可并发布到 npm,可通过 pnpm add vgpu 安装。
Google 发布语音转文本模型 Gemini 3.5 Transcribe,拆成 gemini-3.5-transcribe 与 gemini-3.5-transcribe-live 两个端点,分别通过 Interactions API 处理预录音频、通过 Live API 处理双向流式音频。
Cohere 发布文档解析模型 Parse 5(parse-v5.0),这是一个 2.3B 参数的视觉语言模型,可将 PDF、PPT 和 JPEG 页面直接转为 Markdown,输出含阅读顺序文本、HTML 表格、表单键值对、图像描述和边界框坐标,前面没有独立的 OCR 阶段。
MarkTechPost 从冷启动、按秒计费、文件系统持久化和出网策略四个维度对比 E2B、Daytona、Modal、Cloudflare 与 Vercel 等智能体沙箱。
基于 Anthropic 的 claude-protein-binder-design 数据集,对 1,440 个 AI 设计 miniprotein binder 在 16 个靶点上的计算预测与两家独立实验室湿实验结果进行对比评估。
Google Research 与 UNSW Sydney 发布连续血糖监测基础模型 GlucoFM,将血糖序列拆分为慢变生理状态流与瞬态事件流,以两个 JEPA 式潜空间目标预训练,编码器仅 0.72M 可训练参数。
Z.ai 发布 GLM-5.3-Flash,这是 GLM-5 系列首个原生多模态模型,采用 MoE 架构,320B 总参数、每 token 激活 18B,支持 1,048,576 token 上下文和图像与视频输入,MIT 许可权重已上线 Hugging Face。
阿里 Qwen 团队发布开源权重多模态 MoE 模型 Qwen3.8-Flash-Next,主模型 125B,每 token 仅激活 6B 参数,被定位为 Qwen4 架构的早期预览。
推荐理由:读者可借 6B 激活参数与训练成本对照,判断开源多模态模型在编码和智能体任务上的取舍。
作者认为智能体编码替代的不是初级工程师本身,而是原本交给初级工程师的任务,为此他列出四个必须成立的条件并逐一核对,结论是其中三个不成立。METR 的随机对照实验让 16 名资深开发者在 246 个真实任务上使用 AI,他们预计提速 24%、事后自评快 20%,实际却慢了 19%。
IBM 发布 Granite 4.2 开源推理语言模型系列,包含 3B、8B、30B 三档参数,全部以 Apache 2.0 许可发布。每个模型都能在回答前输出思维链,并提供思考与非思考开关以及低投入模式;8B 和 30B 的后训练链条加入智能体 RL,在真实沙箱环境中学习编辑代码、操作终端和运行网页搜索,3B 只做基础 RL 与对齐。
Liquid AI 开源了端侧基础模型基准测试平台 Pipette,采用 Apache 2.0 许可,同时提供公开结果数据集、托管看板以及 iOS 和 Android 原生测试应用。
Perplexity 发布 Portable Computer,把本地模型、推理引擎、agent harness、工具沙箱和应用连接器打包成一套系统,直接运行在 NVIDIA DGX Spark 上,本地模型处理的任务不计 token 费用。
Meta 推出 MetaRoCE,一种专为 AI 工作负载设计、运行在通用以太网上的全新 RDMA 传输协议,将排序、路径选择与恢复下放到 NIC,把网络视为有损。
Fastino 发布信息抽取模型 GLiNER2.5,用边界预测替代此前的跨度枚举,在 Hugging Face 以 Apache 2.0 协议开源 74M、194M、287M 三个 checkpoint,可通过 pip install "gliner2[local]" 在 CPU、CUDA 或 MPS 上本地推理,目前没有推理服务商托管这些 checkpoint。
Generalist AI 发布机器人基础模型 GEN-1.5,只需向 30 秒上下文窗口放入一次 3–12 秒的传感器运动数据演示,机器人即可执行新物理任务,无需梯度更新或微调。
Google Research 与 USC 发布 Mobility-Embedded POIs(ME-POIs)框架,把聚合人类移动数据融入文本地点嵌入,模型约 53.7M 参数,单张 NVIDIA Tesla V100 16GB 即可预训练。
文章按公开按需定价、已部署与合同电力、硬件路线图和合同结构,对比了 CoreWeave、Nebius、Lambda、Crusoe 与 Groq 五家 GPU 新云厂商。
Harvey 发布首个后训练模型 Harvey Tenet 研究预览版,以 Kimi K3 为基座、通过 Fireworks 异步强化学习训练,面向长周期法律工作。
UC Berkeley 与 UT Austin 研究团队提出边缘原生 MoE 推理引擎 FreeToken,把个人机器当作统一弹性推理平台,可在单张工作站 GPU 上运行 753B 的 GLM-5.2。
推荐理由:文中给出多档消费级与工作站 GPU 的实测吞吐和缓存命中率,可作本地 Agent 推理的选型参考。
MarkTechPost 发布教程,用 deepDoctection 1.2.x 组合 DocLayNet 布局检测、Table Transformer 表格结构识别与 DocTR OCR,搭建端到端文档智能流水线,覆盖阅读顺序重建与标注关联。
Vercel 发布免费工具 Is Agentic,用 Ora 的 100+ 项检查评估网站对 AI 智能体的可发现性、可访问性、可用性与支付支持,并按 A+ 到 F 给出评分。
这篇教程用 NeMo Guardrails 搭建了一套面向 LLM 金融助手的多层护栏管道,把 PII 检测与脱敏、输入输出自检、检索过滤、账号掩码、话题限制和基于策略的工具门控串在同一次请求生命周期里。
Decoding AI 发布开源课程 Building a Coding Agent From Scratch,用 Python 构建名为 Decode 的编码智能体。
MarkTechPost 按公开按需定价、已部署与签约电力,对比了 CoreWeave、Nebius、Lambda、Crusoe 和 Groq 五家 GPU 云厂商。
教程演示用 AutoFigure 从文本描述、类论文内容和结构化方法说明直接生成科研图表,并搭建完整环境、修复 Pillow 兼容性等依赖问题、准备 SVG 与 PNG 渲染工具。
Anthropic 将 Claude Mythos 5 接入 Claude Security,面向 Claude Enterprise 客户开放公测,扫描 GitHub 仓库并追踪跨文件数据流,返回带 CWE 分类、置信度和严重性评级的发现以及修复建议。
Superwhisper 在 Hugging Face 以 Apache 2.0 开源 S1-mini,这是一个 0.6B 文本规范化模型,基于 Qwen3-0.6B 微调,用于在 ASR 之后清理原始转写。