Gradio 推出 gr.Workflow:把 AI 管线变成可拖拽、可部署的节点图
Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。
推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
当前仅显示精选新闻Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。
推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。
斯坦福大学教授 Percy Liang 与 Marin 开放实验室启动 Marin 535B-A23B 模型训练,并全程公开训练过程。该模型有 5350 亿总参数、230 亿激活参数,准备 18.75 万亿 token 训练数据,部署 11 套 GB200 NVL72 约 792 颗 GB200 GPU,预计连续训练约 3 个月,总训练计算量约 2.7e24 FLOPs。
推荐理由:训练数据配比、实时 loss 曲线与实验日志全程公开,为观察前沿大模型训练过程提供了少见的一手材料。
推荐理由:文中给出估值对比与平台托管规模,可据此理解开源模型分发层为何成为收购关注对象。
UC Berkeley 与 UT Austin 研究团队提出边缘原生 MoE 推理引擎 FreeToken,把个人机器当作统一弹性推理平台,可在单张工作站 GPU 上运行 753B 的 GLM-5.2。
推荐理由:文中给出多档消费级与工作站 GPU 的实测吞吐和缓存命中率,可作本地 Agent 推理的选型参考。


推荐理由:报道给出的资金与团队规模,让读者能看清英伟达自研开放权重模型的投入量级及其双线竞争位置。
FireRedTeam 发布 FireRedAudio,一个基于共享 9B LLM 的通用音频语言模型,采用解耦连续表示,Audio Encoder 负责理解、RedAE 通路负责生成。
推荐理由:原文给出模型架构设计和多基准评测数据,并附完整开源代码,读者可据此评估其音频理解与生成能力。
推荐理由:原文说明这些免费端点的提示词与输出会被记录用于改进模型,开放权重为 Apache 2.0,读者可据此判断数据与授权条款。
墨问西东创始人池建强体验 DeepSeek Harness 一天后,叫停刚完成两个多月重构的客户端开发,开始论证全面迁移。
推荐理由:借一位创始人停掉两年自研客户端的决定,呈现插件化 Agent 底座对应用开发与迁移选择的影响。
OpenAI 以 Apache-2.0 许可开源驱动 Codex 的底层执行框架 Harness,并放出三类组件:运行自动化流水线的 codex exec CLI、支持 TypeScript 和 Python 的 Codex SDK,以及通过 JSON-RPC 连接本地 Codex 进程的 app-server。
推荐理由:开源的三类组件与 Harness 调优带来的基准变化,可供开发者评估把智能体嵌入自有产品的落地方式。
Together AI 在 DeepSWE 113 个任务上各跑 4 次对比 GLM-5.3 与 Claude Fable 5,两者 pass@1 统计打平(69.0% vs 69.7%)。
推荐理由:基于 904 次 rollout 的第一手对比数据,给出成本、语言与级联路由的具体结论,可迁移到模型选型决策。
DFlash 2 让 Qwen3.8-27B 在一台 M5 Max MacBook Pro 上跑到 70 tok/s,最高为自回归解码的 4.6 倍,且输出与原始模型完全一致。
推荐理由:DFlash 2 把本地 27B 模型解码从 20 至 30 tok/s 推到 70 tok/s,交互流畅度有了可比较的参照。
Teams are using the open-source Codex harness to bring agents into the tools they already use, from internal apps to operations dashboards. Their applications control the interface, context, tools, and approvals while the harness handles the agent loop. https://t.co/shi2vwqxh4
推荐理由:税务试点把 Codex 用在编码之外,配合开源 harness 展示了智能体接入自有产品的一条路径。
推荐理由:开源发布的智能体运行框架给出本地与托管两种部署路径,并列出同一模型与开放模型下的单次运行成本对比。
推荐理由:作者给出同一基准下的成本对比和多模型路由配置,便于判断自托管 agent harness 的实际取舍。
inclusionAI 开源 Ling-3.0 系列语言基础模型,并按预训练、中训和 WSM 融合三个阶段放出多个检查点,供继续预训练、微调与蒸馏研究使用。
推荐理由:Ling-3.0 系列按预训练、中训、融合三个阶段放出中间检查点,便于研究者做继续预训练与蒸馏对比。
推荐理由:原文交代了 GLM-5.3 的能力侧重、基准分数和开放节奏,读者可以据此判断其在开源与闭源模型中的位置。
DeepSeek V4 Pro 和 V4 Flash 的新价格于8月17日正式生效,V4 Pro 峰时缓存命中价格从每百万 Token 0.003625 美元提高到 0.044 美元,为原来的 12.14 倍,输出价格从 0.87 美元提高到 3.96 美元;V4 Flash 峰时输出从 0.28 美元提高到 1.32 美元,为原来的 4.71 倍。
推荐理由:文章用峰谷价差和订阅额度变化,量化这次涨价对下游开发者与Agent平台的实际成本冲击。
LMSYS 与生态伙伴发布 Miles v0.1,一个基于 slime 设计的全栈生产级后训练系统,目标是让前沿规模 RL 训练更易用。
推荐理由:官方完整走读 Miles 的 RL 训练环路与关键数字,读者可据此评估它是否适合承担自己的前沿规模后训练任务。
Grok Build 现已开源,源码发布在 GitHub 上,包含智能体循环、工具、终端 UI 和扩展系统四部分。公开的代码覆盖上下文组装、模型响应解析、工具调用分发,以及 skills、plugins、hooks、MCP servers、subagents 的加载与调用方式。Grok Build 还支持完全本地运行,可自行编译并指向本地推理,全部通过 config.toml 驱动。
推荐理由:源码公开了智能体循环、工具调用与扩展系统的具体实现,可对照理解自建编码智能体的工程细节。
xAI 以 Apache 2.0 许可开放 Grok-1 的基座模型权重和网络架构。Grok-1 是 314B 参数的 Mixture-of-Experts 模型,每个 token 激活 25% 的权重,由 xAI 使用基于 JAX 和 Rust 的自研训练栈从零训练,预训练阶段于 2023 年 10 月结束。
推荐理由:xAI 以 Apache 2.0 开放 314B MoE 基座权重与架构,读者可据此了解其预训练配置和复用条件。