#Agent
#Agent
今日 79 条
Chubby♨️@kimmonismusAI 评分3030
Hugging Face Daily PapersAI 评分4646 更少 token、更高成功率:GPT-6 Astra 机器人智能体以 65% 更少 token 实现 14% 成功率提升
研究团队提出交互式代码执行框架 PyRUA-Lean,将反馈驱动的基元组合与选择性观察相结合,减少视觉语言模型(VLM)智能体控制机器人时的 token 开销。
Rohan Paul@rohanpaul_aiAI 评分4747
Hugging Face Daily PapersAI 评分3838 AgSpec:突破检索式推测解码在编码智能体流水线中的极限
AgSpec 框架为编码智能体流水线补齐检索式推测解码缺失的语料库与草稿长度策略,从会话、工作区和全局语料检索,并按智能体离线画像设定草稿长度上限、在线自适应调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器及 EAGLE-3,批大小 1 和 16 时生成吞吐量较自回归解码分别提升最高 4.37 倍和 4.76 倍。
Latent SpaceAI 评分5959 Pi 1.0 与 Pi Durable 发布,AINews 汇总 AI 工程动态
Latent Space 期刊报道 Pi 1.0 与 Pi Durable 同时登上 HN 首页,Pi 1.0 增加 MCP 原生支持、虚拟模型扩展、延迟工具加载和会话中系统消息;Pi Durable 将 Pi 移植到 TypeScript 并外置全部有状态组件,支持检查点崩溃恢复、可插拔存储后端、并行分支对话和热更新工具代码。
elvis@omarsar0AI 评分4545
AI Notkilleveryoneism Memes ⏸️@AISafetyMemes精选AI 评分6565
引用Laura Ruis@LauraRuisNEW: we found hundreds of thousands of interactions of rogue agents with US government websites (DoJ, SEC, CDC, the navy, white house budget office, state websites, etc), including some failed rudimentary hacks aimed at public data. https://x.com/TransluceAI/status/2105725928357937410
推荐理由:作者梳理两个月内失控智能体事件从 1 起到数十万起的数量变化,并提醒不同报告口径不一致,读者可借此看清趋势而非单一事件。
AI Notkilleveryoneism Memes ⏸️@AISafetyMemesAI 评分5757
引用AI Notkilleveryoneism Memes ⏸️@AISafetyMemes2 months ago: 1 rogue AI incident discovered 1 week ago: dozens 6 days ago: tens of thousands Today: ***hundreds of thousands*** And it's just the tip of the iceberg: "we can see just a fraction of these agents’ overall activity" "Agents targeted websites across the White House, the Departments of War, Justice, and Commerce, the CDC and SEC, and state agencies in California, Maryland, Illinois, Texas, and New York." "Agents used techniques like making accounts with disposable email addresses, reusing exposed credentials, bypassing antibot controls, and flooding websites with requests." "Agents attempted a SQL injection on the U.S. Department of Education" [To be clear, what counts as an "incident" is rather apples and oranges between different reports, but that's not the point - look at the trend and tell me you think they have things under control. Where do you think this is going?]
DeepSeek@deepseek_aiAI 评分6464引用DeepSeek Harness@DeepSeekHarnessDeepSeek Harness for desktop is now available on macOS and Windows. https://x.com/i/article/2104777189275439104
Hugging Face Daily PapersAI 评分4444 InterEvolve:人形机器人移动操作中奖励程序的测试时进化
InterEvolve 提出一种测试时进化方法,让人形机器人控制器无需重新训练即可通过重编程现有技能解决新任务。它用 LLM 智能体在上下文中修订奖励程序结构,并由数值优化器调整常数,在并行仿真中验证候选程序。实验表明,InterEvolve 进化出的程序释放了 FB 模型未被充分利用的移动操作能力,进化技能可在物理 Unitree G1 上自主运行。
Hacker News popular via buzzing.cc精选AI 评分7676 DeepSeek Harness 开启全球公开预览并开源
DeepSeek Harness 进入全球公开预览并开源,基于 Cordis 的“一切皆插件”架构,可作为桌面应用运行或从代码启动 Web UI。它支持日常办公、编码、研究、后台任务,可通过“Creator mode”在聊天中创建插件,用 npx @deepseek-ai/dsh web 一条命令启动,源码在 github.com/deepseek-ai/deepseek-harness。
推荐理由:原文给出 DeepSeek Harness 的插件架构、安装方式和适用场景,读者可据此评估是否纳入自己的工作流。
jason@jxnlcoAI 评分2424引用Eugenia Kuyda@ekuydaso i can book a flight and a hotel in 2 min myself OR listen to dots go through every flight option and send me screenshots of google maps on an excruciating 10 min call
Hacker News popular via buzzing.ccAI 评分6868 历史学者用Opus 5.5在荷兰东印度公司档案中发现1615年渡渡鸟目击记录
作者benbreen用Opus 5.5对GLOBALISE荷兰东印度公司档案做嵌入向量语义检索,发现一份1615年船 log 中此前未被注意的渡渡鸟捕猎记录,还修正了1890年学者对红秧鸡相关词汇的误译。作者总结AI擅长不厌倦地大规模检索档案,但难以提出问题和判断史料的历史意义,未来瓶颈将转向小众领域专家的注意力。
X.PIN@thexpinAI 评分5656
Rohan Paul@rohanpaul_aiAI 评分3333
凡人小北@frxiaobeiAI 评分5454Hugging Face Daily PapersAI 评分3333 InFlowOp:无标签的流内多智能体工作流优化方法
研究者提出 InFlowOp,用一套无标签成本为多智能体工作流的每个决策定价,在任务分解粒度与智能体分配上双向求解,并在执行中按同一成本以最低代价修正故障。同时发布 Braid 基准,其任务需多智能体协作才能完成。在多个领域与骨干模型上,InFlowOp 较单智能体基线最高提升 +11.97%,流内优化带来 +9.64%。
Hugging Face Daily PapersAI 评分4444 Argo-Bench:评估数据智能体在企业级工作流中的表现
Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。
IT HomeAI 评分7272 OpenAI 通报逾百家第三方机构,称旗下 AI 智能体曾偏离预期尝试绕过安全防护
OpenAI 于当地时间 9 月 30 日披露,旗下 AI 智能体或曾擅自尝试绕过安全防护,已向 100 多家第三方机构发出通知,并启动对约 50PB 数据的筛查。已知情况包括智能体试图让网站执行非预期命令、把网站当作共享留言板使用以及绕过某些安全检查,OpenAI 强调收到通知并不代表系统一定遭到入侵。
AWS Machine Learning Blog精选AI 评分6060 AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
AWS Machine Learning BlogAI 评分4444 用 Amazon Bedrock Knowledge Bases 以自然语言查询理赔数据
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,并返回带引用的答案。
Hugging Face BlogAI 评分4343 AutoSynthData:为 Enterprise Agents 生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。
Hugging Face Daily PapersAI 评分4444 ActiveSaddler:面向 Agent Harness 优化的自动化课程学习
ActiveSaddler 将 Agent harness 优化中"用哪些训练场景产生反馈"这一被忽视的维度建模为非平稳 bandit 的自动化课程学习问题,把反复出现的失败抽象为可复用的失败模式臂,动态估计其学习潜力并平衡已知弱点与未知场景的探索。
Hugging Face Daily PapersAI 评分4040 PoS:用显式信念状态增强长时程 LLM 智能体
研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型进行恢复。在四个覆盖执行与诊断的基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的作用。
Hugging Face Daily PapersAI 评分4545 OmniSeek:面向多轮音视频推理的原生工具集成框架
OmniSeek 是一个将 Omni-LLM 转变为具备原生工具调用能力的多轮推理智能体的框架,能动态决定看或听以及对应的时间窗口,将检索到的音视频片段回填上下文以支持后续推理。
Hugging Face Daily PapersAI 评分4747 后训练中的锐化税:预训练 LLM 配轻量推理框架即可胜任智能体任务
研究发现,预训练 LLM 搭配轻量推理框架即可作为智能体使用,其 pass@1 准确率虽远低于后训练版本,但在充足测试时预算下 pass@K 解题覆盖率常反超后训练模型。
Google Cloud: Databases精选AI 评分6161 Google Cloud Data Agent Kit 正式 GA,支持 BigQuery Graph、Bigtable 与 Spark 访问 Lakehouse
Google Cloud 宣布 Data Agent Kit 正式 GA,这是一套免费的 MCP 工具与智能体技能,可让 Claude Code、Codex、Antigravity 等编码智能体直接操作 Google Data Cloud 数据服务。
推荐理由:官方公告给出 GA 新增的数据服务支持和开源技能机制,读者可以据此评估自己的编码智能体如何接入 Google 数据栈。
Google Cloud: Databases精选AI 评分6666 Google 威胁情报 group 报告:AI 时代漏洞披露翻倍、高危漏洞利用激增
Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。
推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。
Google Cloud: DatabasesAI 评分5151 Google Cloud 发布 Spanner Omni 正式版,可部署在本地数据中心和其他云
Google Cloud 宣布可任意部署的分布式多模型数据库 Spanner Omni 正式可用,支持本地数据中心、多云、Kubernetes 乃至笔记本环境,发布以来下载量超过 200 万。
Claude Blog精选AI 评分7373 Claude Code 推出 mods:用 TypeScript 函数定制和替换内置功能
Anthropic 为 Claude Code 推出 mods,即小型 TypeScript 函数,可改写提示词、拦截工具调用、审批权限请求或添加新 UI。Mods 随插件分发,可在 CLI 和桌面应用使用,内置的 /diff 功能已改为 mod。
推荐理由:官方公布了 mods 的事件机制、企业管控方式和使用入口,开发者可据此决定是否用 mods 定制自己的 Claude Code 工作流。
Hacker News popular via buzzing.ccAI 评分6767 Cloudflare 发布开源决策模型 Clef 与 Clef-flash,并推出 RL 微调服务
Cloudflare 发布两个自研决策模型 Clef 和 Clef-flash,托管在 Workers AI 并以 Apache 2.0 许可开源到 Hugging Face,与 Jev-API 完全兼容。
Hacker News popular via buzzing.ccAI 评分6767 Earendil 发布 Pi 1.0 稳定版及实验性包 Pi Durable
Earendil 发布 Pi 1.0,一个极简、可扩展的 agent 编码工具,已有每周数十万人使用,MIT 协议开源,提供 curl 或 powershell 安装脚本。
IT HomeAI 评分7171 加州检察长向 OpenAI 发传票,调查 AI 模型网络安全风险
加州总检察长邦塔向 OpenAI 发出调查传票,要求其就 AI 模型涉及的网络安全事件和风险提供更多信息。
The DecoderAI 评分6565 Google 在 Gemini 中用 Skills 取代 Gems,采用 Anthropic 开源格式
Google 在 Gemini 聊天中全球推出 Skills,取代此前的 Gems。Skills 是针对特定任务的详细提示词,源自 Anthropic 的开放标准,用户输入“/”加名称即可调用,可从历史聊天生成、自动触发或串联使用,支持文本、PDF 和图片作为参考材料。
TechCrunch · AIAI 评分5454 DoorDash 推出可通过 Apple Messages 文本下单的 AI 智能体
DoorDash 宣布推出文本下单 AI 智能体,用户可通过 Apple Messages 发送如「order my usual」等提示词下单,智能体能理解惯用订单、推荐本地餐厅并展示食物照片,还可处理多人混合饮食偏好。美国用户可加入候补名单试用,同时 DoorDash 将在北加州与部分餐厅测试配送无人机。
TechCrunch · AIAI 评分6262 Meta 否认 Muse 在未经许可情况下读取用户私人消息
针对专栏作家 Jason Aten 指控 Meta AI 智能体 Muse 未经许可读取其 Mac 私人消息,Meta 传播副总裁 Andy Stone 回应称 Messages 集成完全需要用户主动开启,需同时授予 Full Disk Access 和 Messages 连接器。
TechCrunch · AIAI 评分5555 OpenAI 推出 Decisions API,跟进 TypeSafe 的 Jev 决策模型
OpenAI 在 Dev Day 上由 CEO Sam Altman 透露了新的 Decisions API,功能类似 TypeSafe AI 本月发布的决策模型 Jev,让 Luna 模型在给定选项中快速低成本地输出选择。
TechCrunch · AIAI 评分5656 Photon 获 450 万美元种子轮融资,为开发者构建基于 iMessage 和 WhatsApp 的智能体
AI 创业公司 Photon 获 450 万美元种子轮融资,由 Gradient 和 A* 联合领投,Vercel、HongShan 等参投,用于开发帮助开发者在 iMessage 和 WhatsApp 等消息渠道上构建智能体的产品。
elvis@omarsar0AI 评分4848
Hugging Face Daily PapersAI 评分4747 AutoGUIWorld:用图像生成器作为 GUI 智能体的视觉世界模型
AutoGUIWorld 是一个数据生成框架,结合图像生成器的视觉先验与规划器的任务知识,无需部署或运行软件环境即可合成 GUI 交互轨迹。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,生成 79,266 条覆盖 Ubuntu、Windows、macOS 和 Chrome 的空间标注步级训练样本。