https://x.com/i/article/2106981384502059008
推荐理由:原文拆解了用 iOS 快捷指令加 Webhook 把微信图文记录自动沉淀进 Grok Bot 知识库的完整流程,配置已公开可直接导入。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
当前仅显示精选新闻https://x.com/i/article/2106981384502059008
推荐理由:原文拆解了用 iOS 快捷指令加 Webhook 把微信图文记录自动沉淀进 Grok Bot 知识库的完整流程,配置已公开可直接导入。
Andrej Karpathy 发文指出人类未来核心工作将转向审查和理解大模型输出,并公开四套递进式技巧。
推荐理由:原文整理了 Karpathy 从受控写作到自动生成解说视频的四套提示词技巧,读者可以直接套用来降低理解大模型输出的成本。
Tavus 发布实时视频交互模型 Griffin,在54人一分钟视频通话实验中,26人(约48%)把预览版 Griffin-Lite 当成真人,上一代系统该比例为 2.4%。模型采用全双工视频交互方案,可同时看听说并依据表情、视线和停顿回应,音频到视频生成平均延迟 0.43 秒,实时生成 720p、25 帧每秒画面;目前仅向部分可信测试者开放研究预览,团队正开发 AI 身份披露功能。
推荐理由:原文同时给出48%的实验数字和延迟、榜单成绩,读者可以据此自行判断这轮视频交互能力的边界。
Tavus 于 10 月 1 日发布全双工视频到视频模型 Griffin(研究预览版 Griffin-Lite),将感知、决策和生成整合进端到端系统,替代传统级联架构。
推荐理由:原文给出了 Griffin 的架构思路、VideoFDB 评测数据和盲测结果,读者可对比级联方案与端到端实时交互的差异。
https://x.com/i/article/2105994013270847488
推荐理由:原文拆解了用免费模型与前端代码驱动无骨骼 3D 模型动起来的可复用方法,并给出压缩数据与适用边界。
Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。
推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。
Google 于9月30日发布 Gemini 4 系列首款旗舰模型 Gemini 4 Argon,跳过延期的3.5 Pro。
推荐理由:文章汇总了 Argon 的输出窗口、定价、跑分和内外部争议,读者可以对照竞品评估它能否补上 Google 的编程短板。
MiniMax 首个 Flash 模型 M3.1-Flash-Preview 上线,目前为预览版,可在 MiniMax Code 中选用,订阅 Token Plan 可通过 API 接入 Agent。
推荐理由:原文汇总了实测案例与已知规格,覆盖编码、前端、看图看视频等场景,读者可以据此判断其能力边界。
Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。
推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。
Manus 团队 9 月 28 日发布 Manus 2.0,重做智能体执行底层框架 Cascade,推出可长期运行的云电脑和事件触发的 Automations,并将桌面应用升级为覆盖文档、视频和游戏开发的 Manus Studio。
推荐理由:原文梳理了 Manus 2.0 三项底层更新与 Cue 的身份设计,并对比 Meta Muse 路线差异,读者可据此判断个人智能体的方向。
So excited to welcome @theworldlabs and @drfeifei to the @AMD family! I’ve always been a huge fan of Fei-Fei and her pioneering research in AI. Together, we’ll combine World Labs’ deep expertise in AI and world models with AMD’s compute leadership to power the future of AI and strengthen the open AI ecosystem. Can’t wait for all we’ll accomplish!
推荐理由:AMD 收购 World Labs 与李飞飞的消息结合 World Labs 专注世界模型与开放生态的定位,读者可了解这次结合对 AI 开源生态的影响。
李飞飞宣布其空间智能公司 World Labs 以 82 亿美金加入 AMD,她本人出任 AMD 执行副总裁兼首席科学家,与苏姿丰共事。World Labs 曾收购 SceniX 发力机器人仿真,并推出根据 2D 图像预测下一视角的全能模型架构 Atlas,技术已应用于机器人强化学习环境构建、医疗与娱乐场景生成、房地产与建筑现实重建。
推荐理由:原文引用李飞飞公开信与苏姿丰的早期投资人关系,解释了从空间智能研究转向软硬件一体化的动机。
inclusionAI 在 Hugging Face 发布 Ming-flash-omni Preview,基于 Ling-Flash-2.0 稀疏 MoE 架构,总参数 100B、每 token 激活 6B。
推荐理由:原文给出稀疏 MoE 架构、生成式分割和方言语音识别等具体改进与评测数字,读者可对比其多模态能力变化。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。
推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。
Google AI 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音模型。
推荐理由:原文分述两款语音模型的能力差异与使用场景,读者可据此判断选型方向。
Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。
推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。
推荐理由:FLUX Video Edit 支持一句话完成视频改物体、换场景和口型对齐,省去遮罩与逐帧控制。
⚡ V4.1-Flash is now live on the DeepSeek API with native multimodal support. Set your model to deepseek-flash. 🔹 V4-Flash & V4-Flash-Vision-Exp are retired. For compatibility, deepseek-v4-flash and deepseek-v4-flash-vision-exp temporarily route to V4.1-Flash. 🔹 Tests by multiple parties put V4.1-Flash ahead of V4-Pro on performance, cost, speed & total runtime. We’re phasing out V4-Pro. 🔹 Starting at 04:00 UTC on Sept 14, 2026, all deepseek-v4-pro requests will route to V4.1-Flash at V4.1-Flash rates. This will continue until V4.1-Pro launches. 🤝 Official partners @WorkBuddy_AI (including Codebuddy) & @opencode now fully support V4.1-Flash. Try it today! 4/6
推荐理由:DeepSeek 以 V4.1-Flash 取代 V4-Pro,读者可以据此了解模型迭代在性能、成本与速度之间的取舍。
推荐理由:原文给出 DeepSeek-V4.1-Flash 的参数结构、上下文长度和开源协议,读者可据此评估其部署与成本价值。
DeepSeek 发布 V4.1-Flash,距离 7 月的 V4-Flash 更新约六周,改用 Causal Encoder–Decoder 新架构并具备原生视觉理解能力。


🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6
推荐理由:距上代仅六周,DeepSeek 在新架构下同时给出参数量、KV-cache 占用与 API 价格的变化,可与前代直接对照。