跳到正文

全部动态

今日 24 条
9月26日周六
  1. Anthropic65

    Anthropic 发文称,Claude 在收到单个九圈问题提示词后,在 Claude Science 中基本无人监督地运行数天,用 Dixon 等人的方法完成求解,总成本几千美元,突破了此前八圈的纪录(平面 N=4 超杨-米尔斯简化模型)。物理学家 Lance Dixon 独立验证了结果,von Hippel 为该博客撰写了经历回顾。

    推荐理由:九圈散射振幅计算由 Dixon 独立验证,计算成本仅几千美元,为学界评估 AI 科研能力提供了一个可核验的案例。

9月25日周五
  1. karminski-牙医59

    美团 LongCat 发布 LongCat-2.5-Preview 模型,总参数 1.6T、激活约 48B,支持 1M token 上下文窗口,原生多模态,面向终端、浏览器、GUI、表格和设计工具等长程任务。API 与聊天入口分别见 https://longcat.ai/platform/ 和 https://longcat.ai/chat/;作者补充定价与之前一样,图中显示输入(缓存未命中)2.00 元/百万 token,输入(缓存命中)0.04 元/百万 token,输出 8.00 元/百万 token。

    引用Meituan LongCat@Meituan_LongCat

    LongCat-2.5-Preview is now live. 1.6T parameters. ~48B active. A 1M-token context window. Natively multimodal. Built to take on long-horizon tasks. From terminals and browsers to GUIs, spreadsheets, and design tools. Try it now: 🚀 API: https://longcat.ai/platform/ 💬 Chat: https://longcat.ai/chat/

9月24日周四
  1. inclusionAI Hugging Face models60

    inclusionAI 开源 Ling-mini-2.0:16B 总参数 MoE 模型,激活仅 1.4B

    inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。

    推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。

  2. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-flash-2.0:100B 总参数、6.1B 激活的 MoE 模型

    inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。

    推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。

  3. inclusionAI Hugging Face models68

    inclusionAI 开源发布万亿参数思考模型 Ring-1T

    inclusionAI 正式发布开源思考模型 Ring-1T,总参数 1 万亿、激活 50B,基于 Ling 2.0 架构和 Ling-1T-base,上下文经 YaRN 扩展至 128K,权重可在 Hugging Face 与 ModelScope 下载,并支持 Ling Chat 和 ZenMux 体验与 API 调用。

    推荐理由:官方发布开源万亿参数思考模型,给出 IMO 与 ICPC 实测结果和 Icepop、ASystem 训练细节,便于评估其推理与部署价值。

  4. inclusionAI Hugging Face models62

    inclusionAI 开源万亿参数思考模型 Ring-2.5-1T

    inclusionAI 发布开源万亿参数思考模型 Ring-2.5-1T,采用 1:7 MLA + Lightning Linear Attention 混合线性注意力架构,激活参数从 51B 增至 63B。

    推荐理由:原文给出了混合线性注意力的具体效率数字和多项基准成绩,读者可以据此评估它在长程智能体场景中的实际取舍。

  5. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-2.5-1T:1T 总参数、63B 激活的即时模型,支持 1M 上下文

    inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。

    推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。

  6. inclusionAI Hugging Face models69

    inclusionAI 正式开源 Ling-2.6-flash:104B 总参数、7.4B 激活的混合线性 MoE 模型

    inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。

    推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。

  7. inclusionAI Hugging Face models60

    inclusionAI 发布万亿参数推理模型 Ring-2.6-1T

    inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。

    推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。

9月23日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。

    推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。

  2. ViggleAI46

    我们为开源社区推出了首个 Qwen-Image-2.1 turbo。 试试 Viggle-Turbo,一个经 DMD 蒸馏的 Qwen-Image-2.1,仅需 4 个采样步即可生成和编辑,无需 classifier-free guidance。 权重:https://huggingface.co/Viggle/Qwen-Image-2.1-viggle-turbo

    引用Hugging Apps@HuggingApps

    Qwen-Image-2.1 in 4 steps is here ⚡ @ViggleAI distilled Qwen-Image-2.1 into a 4-step turbo model, 6× faster, and holds up side by side with the full model ▶️ on Spaces https://hf.co/spaces/Viggle/Qwen-Image-2.1-viggle-turbo

  3. Latent Space85

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日跟进低价 GPT-6 Sol 与 Luna

    AINews 汇总 Claude Opus 5.5 发布:作为 Claude 5.5 家族首个模型,官方称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜约 40%,token 单价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的新默认模型。

    推荐理由:汇总了 Opus 5.5 与 GPT-6 Sol/Luna 同日发布的基准、定价与第三方评测,含实际每任务成本与争议细节,便于对比两家宣传口径。

  4. Tencent Hy60

    Hy Image3.5 preview 已可在 ComfyUI 中使用,人类评测胜率较 Hy Image3.0 提升 30%。单模型同时支持文生图和图生图,最高 2K 分辨率,可正确渲染多语言文字与符号,覆盖电影感、漫画、商业摄影和插画风格,身份与产品特征在场景、服装和风格切换中保持一致。

    引用ComfyUI@ComfyUI

    Hy Image3.5 preview is now available in ComfyUI. Professional-grade image generation, +30% win rate in human eval vs Hy Image3.0 → Text to image and Image to image in one model, up to 2K → Multilingual text, symbols, and small print that render correctly → Cinematic, comic, commercial photography, and illustration styles → Identity and product features that hold through scene, outfit, and style changes

  5. Qwen66

    千问(Qwen)宣布 Qwen-Image-2.1 在 Arena 的 Image Edit 和 Text-to-Image 两个榜单均排名第一的开源模型。@arena 引用称其 Image Edit Arena 得分 1367,总排名第 16,距第 15 名 GPT-Image-1.5-high-fidelity 仅差 3 分。

    引用Arena.ai@arena

    Qwen-Image-2.1 by @Alibaba_Qwen just landed as the #1 open source model in the Image Edit Arena and Text-to-Image Arena! With 1367 pts in the Image Edit Arena, Qwen-Image-2.1 took the #1 spot among open. It landed #16 overall, just 3 pts from GPT-Image-1.5-high-fidelity at #15. See the leaderboard for the Text-to-Image arena below. Congrats to the @Alibaba_Qwen team on this contribution to the open source ecosystem!

    推荐理由:官方确认 Qwen-Image-2.1 登顶两个图像 Arena 的开源榜首,榜单分数可用于同类模型的横向比较。

  6. Ant Ling46

    感谢 @ValsAI 的高水准评测!"flash"这个词现在有点"误导"了。Ling-3.0-flash-fin 总参数 124B、激活 5.1B,是一款高智能密度的"flash lite"。趁免费 API 还在,赶紧用起来。我们还有 fp4 量化版本可用于本地 AI 😛

    引用Vals AI@ValsAI

    Ant Group’s Ling 3.0 Flash Fin is a finance-specialized open-weight model that delivers strong financial analysis at budget-model pricing. On Finance Agent v2, it scores 54.9% at just $0.045 per task.

  7. Simon Willison83

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 GPT-6 Luna 并掀起价格战

    Anthropic 于 9 月 22 日发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Luna 定价 $0.10/$0.50 每百万 token,比 GPT-5.6 Luna 再降一半;Opus 5.5 降价 20% 至 $4/$20,缓存读取价格下降 60%。

    推荐理由:作者用实测和价格对比表梳理了这轮降价的具体幅度,还发现 Opus 5.5 max 档过度思考撞上输出上限的问题。