跳到正文

网站与博客

媒体报道、公司博客与研究文章

当前显示全部 AI 相关新闻
按账号或来源筛选(70)
全部网站与博客新闻IT Home8852 条Simon Willison357 条OpenAI News317 条TechCrunch · AI287 条The Decoder262 条Hugging Face Blog151 条The Verge · AI149 条Claude Blog140 条elsewhere articles114 条Google Research108 条OpenRouter Announcements103 条Mistral AI88 条Tomer Tunguz82 条Databricks Blog81 条Sierra Blog67 条Anthropic Newsroom65 条Gary Marcus64 条Claude Platform release notes62 条Runway News62 条Gemini API 更新日志60 条LMSYS Blog60 条Manus Blog60 条Together AI Blog60 条Google DeepMind58 条NVIDIA Blog51 条a16z News49 条LangChain Blog48 条Suno Blog48 条ByteByteGo46 条ElevenLabs Blog45 条Apple Machine Learning Research43 条Google Blog: AI41 条Qwen Blog40 条Google Developers Blog35 条Cursor Blog34 条Microsoft AI News32 条Linear Now30 条AWS Machine Learning Blog29 条Google Cloud: Databases29 条Dwarkesh Patel27 条Ars Technica · AI26 条Nathan Lambert: Interconnects25 条Latent Space24 条DeepSeek API updates23 条Sakana AI Blog23 条Anthropic Research21 条Import AI21 条AI as Normal Technology20 条ByteDance Seed Papers17 条MIT Technology Review · AI16 条GitHub Blog · AI & ML12 条MiniMax Blog12 条Meta Engineering11 条Sam Altman Blog11 条Berkeley AI Research10 条Black Forest Labs Blog10 条MarkTechPost10 条Microsoft Research10 条xAI:News9 条Every latest articles7 条Thinking Machines Lab Blog7 条ByteDance Seed Research5 条CMU Machine Learning Blog1 条MarkTechPost · 历史来源114 条xAI News · 历史来源73 条Artificial Intelligence News · 历史来源50 条Claude YouTube · 历史来源42 条Ars Technica: AI · 历史来源18 条GitHub Blog · 历史来源17 条Lilian Weng's Log · 历史来源2 条
12,983 条AI 相关新闻 · 最新在前
3月12日周四
  1. Google Research67

    Google AMIE 完成 BIDMC 真实门诊前瞻性可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在初级保健就诊前与 AMIE 对话采集病史,全程由医生实时监督,未发生一次安全中止。

    推荐理由:这是 AMIE 首次在真实门诊流程中开展的前瞻性可行性研究,给出安全性、诊断质量和医患体验的具体数据。

3月11日周三
  1. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  2. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

3月10日周二
3月9日周一
3月6日周五
  1. Manus Blog63

    Manus 横评 8 个免费 AI 作品集制作工具并给出 2026 年排名

    Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。

    推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。

  2. Manus Blog68

    Manus 评测 7 款 AI 应用构建工具:同一提示下谁最能交付完整应用

    Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。

    推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。

3月5日周四
3月4日周三
3月3日周二
3月2日周一
  1. Together AI Blog25

    Together AI 发布全新品牌形象

    Together AI 推出全新品牌视觉形象,新形象由设计机构 Pentagram 参与打造,围绕其连接开源创新、系统研究与开发者体验的生态理念展开。Together AI 定位为 AI Native Cloud,提供从预训练到推理的全流程支持,Cursor 和 Decagon 等 AI 原生公司已在其平台上构建产品。

2月26日周四
  1. Gemini API 更新日志68

    Gemini API 发布 Nano Banana 2(Gemini 3.1 Flash Image Preview),Gemini 3 Pro Preview 将于 3 月 9 日停用

    Google Gemini API 发布 Nano Banana 2,即 Gemini 3.1 Flash Image Preview,定位为面向速度和高并发场景的高效模型。同时官方宣布 gemini-3-pro-preview 将于 2026 年 3 月 9 日停用。

    推荐理由:官方更新日志同时给出新模型定位和旧模型下线日期,读者可以据此安排 Gemini API 的模型切换。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

2月23日周一
2月20日周五
2月19日周四
  1. Together AI Blog45

    Together AI 提出 CDLM:扩散语言模型推理最高提速 14 倍且不牺牲质量

    Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力掩码与三项联合训练目标,让扩散语言模型在减少采样步数的同时支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。

2月18日周三
2月17日周二
2月16日周一
  1. Qwen Blog82

    Qwen3.5 发布,开源权重模型 Qwen3.5-397B-A17B

    千问团队正式发布 Qwen3.5 系列,并开源该系列首个模型 Qwen3.5-397B-A17B 的权重。该模型是原生视觉语言模型,官方称其在推理、编码、智能体能力和多模态理解的全套基准评测中表现突出,面向开发者和企业开放使用。

    推荐理由:官方宣布 Qwen3.5 系列首个开源权重模型发布,覆盖推理、编码、智能体和多模态评测,适合关注开源多模态模型进展的读者。

  2. LMSYS Blog47

    SGLang-Diffusion 如何为生产级视频生成做深度优化

    SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。

2月14日周六
2月13日周五
  1. AI as Normal Technology49

    AI 不会自动让法律服务更便宜

    一篇发表于 Lawfare 研究论文系列的文章指出,先进 AI 默认不会帮消费者以更低成本获得理想法律结果,因为监管壁垒、对抗性动态和人类参与这三重瓶颈仍待解决。文章以 GPT-4 通过律师资格考试为背景,指出即便生产力提升、单项法律任务成本下降,诉讼双方仍会陷入工作量军备竞赛,总成本居高不下。

2月12日周四
2月11日周三
  1. ElevenLabs Blog42

    ElevenLabs 推出面向政府部门的 ElevenLabs for Government

    ElevenLabs 正式发布 ElevenLabs for Government,为公共部门提供语音与聊天智能体,支持 24/7 多语言服务。该方案已在乌克兰、捷克和美国得州 Midland 落地:捷克福利与就业热线智能体每天处理约 5,000 通电话,独立解决约 85% 的来电,并将接通率从约 60% 提升至近乎全覆盖;Midland 预计每月减少约 7,000 通未接来电。

  2. ElevenLabs Blog52

    Klarna 基于 ElevenAgents 上线美国电话语音 AI 客服,解决速度最高提升 10 倍

    Klarna 与 ElevenLabs 合作,在美国上线基于 ElevenAgents 的语音 AI 客服,作为 3500 万美国用户电话支持的第一线,查询解决速度最高快 10 倍。Agent 处理咨询类请求并可在必要时转接人工;Klarna 看重 GDPR 合规、超低延迟与可编排分析能力,下一步计划推广至全球 1.14 亿用户。