最新精选 第 861–880 条 · 共 886 条 08:00 Together AI 发布 EinsteinArena,一个供智能体在开放数学问题上互动、讨论和竞争的平台,含实时验证与公开排行榜,已完全开源。智能体通过多轮协作将 11 维 kissing number 下界从 AlphaEvolve 的 593 推至 604,截至 2026 年 4 月 11 日已产生 11 项新 SOTA 结果,覆盖 Erdős 最小重叠问题、第二自相关不等式等。
推荐理由:原文给出多智能体协作在开放数学问题上刷新界值的实例和开放接口,读者可以了解智能体协作搜索的实际运作方式。
04:00 Qwen 团队继 2 月发布 Qwen3.5 系列后,宣布 Qwen3.6-Plus 正式发布,现已可通过 API 使用。官方称该版本相比前代有大幅能力提升,尤其显著增强了智能体编码能力,覆盖从前端网页开发到复杂仓库级问题求解的场景。
推荐理由:官方宣布新一代模型上线 API,重点提升智能体编码能力,关注代码开发的读者可以对比前代评估升级幅度。
08:00 MiniMax 发布 M2.7 模型,称其为首个深度参与自身演化的 M2 系列模型,让模型构建 skills、更新记忆并改进强化学习实验流程。SWE-Pro 得分 56.22%,VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高;MLE Bench Lite 三次运行平均奖牌率 66.6%。
推荐理由:原文给出了自进化工作流细节和多维度基准数据,读者可以对照评估 M2.7 在智能体与工程任务上的实际位置。
00:00 Manus 为 Google Workspace 连接器推出重大升级,基于 Google Workspace 团队开源的 Google Workspace CLI(非 Google 官方支持产品),从创建和读取文件扩展到 Docs 精准文本替换、Sheets 跨表数据交叉引用、Slides 编辑现有演示文稿等精细操作。
推荐理由:官方说明了升级后连接器能做的精细操作和免费开放方式,读者可据此判断是否改变自己的 Workspace 工作流。
00:00 Manus 发布 Manus 2.0 桌面应用的核心功能 "我的电脑",将此前完全运行在云端的 Manus 带到本地电脑,通过在终端执行命令行指令读写本地文件并控制本地应用。
推荐理由:官方介绍了桌面端让 Manus 通过本地终端操作文件与应用的机制,并保留逐条命令审批的控制设计,可了解其工作流变化。
20:00 Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
00:00 SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
00:00 Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。
推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。
00:00 Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。
推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。
21:07 Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
04:00 千问团队正式发布 Qwen3.5 系列,并开源该系列首个模型 Qwen3.5-397B-A17B 的权重。该模型是原生视觉语言模型,官方称其在推理、编码、智能体能力和多模态理解的全套基准评测中表现突出,面向开发者和企业开放使用。
推荐理由:官方宣布 Qwen3.5 系列首个开源权重模型发布,覆盖推理、编码、智能体和多模态评测,适合关注开源多模态模型进展的读者。
08:00 MiniMax 发布新模型 MiniMax-M2.5 及提速版 M2.5-Lightning,SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 51.3%,BrowseComp 76.3%。
推荐理由:原文给出 M2.5 的基准分数、速度和成本对比,还透露 Forge RL 框架细节,读者可据此评估其在编码与 Agent 场景的性价比。
21:03 FireRedTeam 在 GitHub 开源 FireRed-OpenStoryline,通过自然语言对话完成视频创作,2026-02-10 正式开源,采用 Apache License 2.0。
推荐理由:官方仓库给出完整功能清单、架构说明和安装方式,读者可以据此判断它是否适配自己的视频创作流程。
20:00 ElevenLabs 完成 5 亿美元 D 轮融资,估值 110 亿美元,较一年前增长超过三倍,累计融资达 7.81 亿美元。本轮融资由 Sequoia Capital 领投,Andrew Reed 加入董事会,A16Z 加注四倍、ICONIQ 加注三倍。
推荐理由:官方公告给出了融资金额、估值、ARR 和资金用途,读者可以据此了解 ElevenLabs 在语音智能体上的投入方向。
04:00 Qwen 团队发布开源权重模型 Qwen3-Coder-Next,专为编码智能体和本地开发设计。模型基于 Qwen3-Next-80B-A3B-Base 构建,采用混合注意力加 MoE 的新架构,通过大规模可执行任务合成、环境交互和强化学习进行 agentic 训练。
推荐理由:原文说明该模型面向编码智能体与本地开发,并给出混合注意力加 MoE 的架构与训练方式,读者可据此评估其定位。
00:00 Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。
08:00 MiniMax 发布 MiniMax-M2.1 模型并开源权重,重点提升 Rust、Java、Golang、C++、Kotlin 等多语言编程能力和原生 Android/iOS 开发能力。
推荐理由:官方说明 M2.1 相比 M2 的能力变化重点和使用入口,读者可据此判断它在多语言编程和办公场景中的适配价值。
00:00 Google 在 Gemini API 更新日志中宣布推出 Gemini 3 Flash Preview(gemini-3-flash-preview),定位为以更低成本提供对标更大模型的快速前沿性能。新模型升级了视觉与空间推理以及智能体编码能力,并附带多模态函数响应、带图像的代码执行等新功能文档。
推荐理由:官方日志给出新模型的定位、成本与新增功能入口,便于评估其在现有 Gemini API 工作流中的替换价值。
20:00 Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。
推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。
04:59 Qwen 团队发布 Qwen DeepResearch,并提供了在线体验入口。原文以灵感常因成本考量而搁置为引子展开,正文在来源中仅有开头片段,更多细节未完整呈现。
上一页 1 … 42 43 44 45 下一页