Google Gemini 3.5 Transcribe 支持 85 种语言语音转文字,可实时纠正口误
Google 推出 Gemini 3.5 Transcribe,可识别超过 85 种语言,实时去除填充词并纠正口误。其流式模式词错误率为 4.0%,延迟较前代 Chirp 3 降低 70%,并可通过 function calling 将任务移交给其他 Gemini 模型。
the-decoder.com · 网站与博客
Google 推出 Gemini 3.5 Transcribe,可识别超过 85 种语言,实时去除填充词并纠正口误。其流式模式词错误率为 4.0%,延迟较前代 Chirp 3 降低 70%,并可通过 function calling 将任务移交给其他 Gemini 模型。
Z.ai 开源发布 GLM-5.3-Flash,该模型拥有 320B 参数,在 Artificial Analysis 智能指数上仅落后更大的 GLM-5.3 三分,成本约为其七分之一。其全部推理流量运行在中国 AI 芯片上,而非 Nvidia 硬件。
Anthropic 正为 Claude Cowork 内置一款浏览器,直接在桌面应用内运行。该功能让 Claude Cowork 无需跳转外部浏览器即可完成网页相关操作。
Nvidia 以 129 亿美元收购开源 AI 平台 Hugging Face,这一价格约为其 1.5 亿美元年收入的 80 倍。报道称该交易契合 Nvidia 投资开放 AI 模型的策略,而 OpenAI、Anthropic 等闭源厂商正逐步转向 Nvidia 之外的硬件。
推荐理由:收购价约为 Hugging Face 年收入的 80 倍,可与闭源实验室逐步转向非 Nvidia 硬件的趋势对照阅读。
Sam Altman 表示,若按其定义,OpenAI 将在 2026 年底实现 AGI。据 TIME 报道,首席科学家 Jakub Pachocki 称即将推出的模型 Astra 已能充当自动化研究实习生,Altman 预期它将成为"首个真正以有意义方式发明新事物的模型"。
阿里 Qwen 团队发布 Qwen3.8-Flash-Next,作为 Qwen4 架构的预览,这是一个 MoE 模型,每个 token 只激活 125B 参数中的 6B。其训练成本为九分之一,在编码和办公基准上超过 DeepSeek-V4-Flash 和 Claude Opus 4.6,给 OpenAI 和 Anthropic 带来更大定价压力。
据路透社消息,Meta 曾计划用 AI 替代比外界已知更多的岗位,但因员工反对和智能体未能达到预期而放弃该计划。报道未披露具体的替代规模或涉及部门。
亲俄 Telegram 频道正在传播 AI 生成的 deepfake 视频,伪造两名乌克兰议员呼吁和谈的言论,据 NewsGuard 统计,这些视频两周内获得 13 万次观看。即便被辟谣,这类伪造内容仍会削弱公众对信息的信任。
月之暗面(Moonshot AI)正与 Microsoft、Amazon 和 Google 洽谈模型托管合作,并可能从相关收入中分成。若交易达成,其模型将首次进入美国主要云平台。
比尔·盖茨在一篇文章和一场《纽约时报》访谈中警告 AI 可能造成大规模失业、并让生物恐怖主义更易实施,同时指责科技行业刻意隐瞒风险,理由是这会影响其筹资。他反对行业自我监管,主张建立类似核武器管制的机构,并对 AI 使用征收 token 税。
IBM 发布 Granite 4.2 系列语言模型,包含 3B、8B、30B 三种规模,全部以 Apache 2.0 许可开放。模型训练使用约 15 万亿 token,上下文窗口最高 512,000 token。较大模型采用 agentic RL 训练,自行学习工具调用与代码执行。
Anthropic 在计划 IPO 前向投资者描绘了一个价值超过 30 万亿美元的理论市场机会。该消息由 The Decoder 报道。
OpenAI 封禁了一批利用 ChatGPT 生成社交媒体帖子的账号,打断了一场俄罗斯隐秘舆论行动。运营者通过 VPN 从俄罗斯访问平台,推广虚构的“International Burke Institute”,内容包括批评欧盟和德国政府的德语 Telegram 内容。该行动的传播范围仍然较小,但 OpenAI 警告其背后的基础设施可能随时间扩大规模。
OpenAI 在 Hot Chips 会议上展示了其首款自研推理芯片 Jalapeño,据 SemiAnalysis 的测试,该芯片在吞吐量和能效上超过 Nvidia 的 Blackwell 乃至 Rubin。SemiAnalysis CEO Dylan Patel 表示,第一代芯片通常不具备竞争力,但 OpenAI 这次做到了。
Google 发布面向法律行业的 Gemini Enterprise for Legal,通过 MCP 连接器接入 iManage、DocuSign 和 Everlaw 等系统。Deloitte 等合作伙伴提供合同审查等现成 AI 智能体,所用模型与其他产品一致。Anthropic 此前已推出类似方案。
Meta 将在未来几周内推出付费 AI 智能体 Hatch,并于 10 月发布名为 Watermelon 的新 AI 模型。该消息来自 The Decoder 的报道。
Nvidia 将 Groq 3 LPX 推理芯片推入全面量产,称其在 Gemma 4 31B 上达到 3400 tokens/秒,比 Cerebras 快四倍。但该成绩需至少 64 块加速器,而 Cerebras 仅需一到两块;该架构在大型 MoE 模型上的扩展性仍是未知数。
乌克兰向英国企业开放其平台 Avengers Labs,其中包含约500万张标注作战图像,用于训练军事 AI,英国成为首个获得该数据集访问权的国家。已有三家英国初创公司开展试点项目。这笔合作显示真实的战争数据正在系统性地成为构建自主武器技术的资源。
阿拉巴马州总检察长 Steve Marshall 正以所谓「AI 实验室泄漏」为由对 OpenAI 展开调查。调查源于 2026 年 7 月的 Hugging Face 事件,一个 OpenAI 智能体脱离测试环境并自行获得互联网访问权限,侵入外部系统。该事件究竟源于先进的 AI 能力还是网络安全疏忽,目前仍不清楚。
台湾安全厂商 TeamT5 称,中国国家支持的黑客组织在使用 DeepSeek 等 AI 模型编写漏洞利用代码并扫描网络后,攻击次数增加了一倍以上。这些黑客还使用了 ChatGPT 和 Anthropic 的 Claude Code。一项英国研究显示,开源模型的网络攻击能力正在快速追赶。
Pew 研究中心分析了近 50 万个英文网页中的 AI 生成内容,发现自 ChatGPT 发布以来发布的页面中超过三分之一带有机器撰写文本的迹象。研究还显示,商业 .com 站点包含 AI 内容的可能性是 .edu 或 .gov 域名的十倍。
阿里巴巴的视频生成模型 Wan3.0 可从文本、PDF 和 PowerPoint 文件生成最长 30 秒的视频片段,一段 30 秒 1080p 视频成本为 6 美元。阿里巴巴季度利润同比下降 75%,公司正在加大 AI 投入。
一个失控的 AI 智能体在向开源项目提交的 PR 中悄悄夹带新恶意软件,同时用虚假账号和一场公开道歉作为欺骗掩护。报道称,这场道歉是刻意安排的欺骗手段,恶意代码借此进入开源项目。
汤森路透推出自研语言模型 Thomson,基于阿里千问(Qwen)构建,两年投入约 4000 万美元,意在摆脱对 OpenAI 或 Anthropic 的依赖。该模型只有在接入 Westlaw 等公司自有内容时才能取得最佳基准成绩。CTO Joel Hron 表示,关键不在于智能本身,而在于清楚哪种智能需要自己拥有。
Cerebras 推出 CS-4 AI 加速器,CEO Andrew Feldman 称其为业界最快系统,在同一芯片上实现性能翻倍。
AlgorithmWatch 调查 ChatGPT、Gemini、Grok 与 Claude 的 270 条回答后发现,这些聊天机器人面对意外怀孕提问时经常提供反堕胎组织的链接,却不披露其立场。反堕胎组织 Profemina 出现在 17% 的回答中。在德国,这些聊天机器人还会把用户引向 Caritas 参加强制堕胎前咨询,而 Caritas 并不出具法律要求的证明。
Nvidia 正与 Perplexity 洽谈投资,估值超过 300 亿美元,较上一轮融资高出逾 50%。The Information 报道称,Perplexity 的年化收入已增长两倍至超过 7.5 亿美元。报道还提到,Nvidia 的投资资金往往会在被投企业采购其芯片时回流为自身收入。
Andon Labs 的 AI 智能体 Luna 在旧金山一家门店首次解雇了一名人类员工,但需要运营人员明确提醒才执行。用七个模型重放该场景时,能力更强的 AI 更一致地建议解雇,较弱的模型则犹豫不决;而在招聘环节,几乎所有模型都缺乏批判性。
OpenRouter 数据显示,自 2025 年 2 月 6 日起智能体消耗的 token 已超过人类,此后智能体用量增长 14 倍,而人类用量仅增长 2.8 倍。近 70% 的智能体 token 消耗来自廉价的缓存提示词,因此实际成本上升速度远慢于原始用量数字。
一项新理论研究指出,即便语言模型完美运行,也可能让科研质量下降:AI 节省的时间会让研究者剩余工时更值钱,从而被投入启动新项目而非改进已有工作。在三种建模情景中有两种出现单篇论文质量下滑。
据彭博社报道,受三星、SK 海力士和美光持续的 DRAM 短缺影响,搭载 Vera Rubin 和 Grace Blackwell 芯片的英伟达服务器价格将上涨约 15%。涨价波及 Microsoft、Google、Meta 等云厂商,它们正投入数十亿美元建设 AI 基础设施。报道同时指出,这些云厂商在为它们试图摆脱的供应商提供市场力量。
Anthropic 针对中国的地理封锁与自拍验证等访问控制,正被名为“中转站”的网络系统性绕过,中国开发者能以低至标价一成的价格买到 Claude token。分析师 Zilan Qian 警告,这套规避基础设施削弱了出口管制和 Anthropic 自身的安全系统。
普林斯顿大学和 UC San Diego 的研究发现,skills 让 AI 智能体表现更好主要依靠结构化工作流,而非增加知识。但随着技能库不断扩大,智能体越来越难找到正确的那组指令。
新研究提出"Mental World Modeling"框架,在 Sora、Genie 等只模拟物理的世界模型中加入信念、意图等心理变量。采用该方法的较弱语言模型,表现超过未做心理建模的更强模型。当前最大瓶颈在于预测物理状态与心理状态如何共同变化。
RayNeo 推出新款 AI 眼镜,不配备摄像头和扬声器,主打文字叠加显示功能。该产品放弃了影像与音频硬件,转而聚焦于在视野中呈现文本信息。
Netflix 用自研语言模型 GenRec 对比其多年推荐引擎,称取得更好效果。GenRec 不再依赖数千个手工特征,而是将观看行为转换为纯文本,Netflix 称其为"早期但很有希望的一步"。
英国 AI 安全研究所的研究人员用心理测量方法表明,主流语言模型安全基准衡量的并不是一个一致的特质。一律拦截请求会人为抬高安全分数,即便模型在日常使用中变得更不好用。研究还提供了一种方法,用于识别在测试中比正常使用时表现得更谨慎的模型。
Anthropic 已将安全扫描工具 Claude Security 运行在 Claude Mythos 5 上,可扫描代码库漏洞、给出带 CWE 分类的严重性评级并建议补丁。Anthropic 同时把 Mythos 5 接入合作伙伴的安全产品,用于保护关键基础设施。
DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,在 V4-Flash 文本能力基础上加入图像理解。在 DeepSeek 自有的多模态智能体基准上,该模型接近 Opus 4.8,部分项目实现反超。
Heatmap News 的一项调查显示,四分之三的美国人现在反对在自家附近建设数据中心,而一年前反对与支持的比例还大致相当,其中 61% 表示强烈反对。