AI 进步是否在放缓:Arvind Narayanan 等人解析模型扩展与推理扩展之争
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。
媒体报道、公司博客与研究文章
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。
推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench(08.01-12.01)准确率从 29.2% 提升至 34.38%。中文写作与推理能力在内部测试集中也有提升,同时优化了文件上传和网页总结功能的用户体验。
Suno 正式推出 Android 版,这是其首个 Android 版本,用户可通过文本提示词创作音乐、发现创作者社区的新曲目与风格并分享作品。官方表示该版本先上线核心功能,后续将持续迭代,目前已可下载使用。
Suno 发布 v4 音乐生成模型,带来更干净的音频、更清晰的歌词和更有动态的歌曲结构。新功能包括 Remaster 旧曲目升级到 v4 音质、歌词辅助模型 ReMi 和封面生成,Covers 与 Personas 也已由 v4 驱动,目前以 beta 形式向 Pro 和 Premier 订阅开放,可在 suno.com 和 iOS 使用。
推荐理由:官方发布说明列出了音质、歌词、封面和功能升级点,读者可以据此判断是否升级使用。
Scale AI 在产品与工程团队推动下全员迁移到 Linear,此前各团队分散使用多种工具,导致 issue 重新分配、上下文共享和进度追踪困难。迁移后 Scale 的 bug 解决时间缩短 52%,并借此支撑其 AI 数据产品的快速扩张。
Suno 官宣 Jack Brody 加入担任首席产品官,负责产品与设计。Jack 曾在 Snap 工作十年,离职前担任产品负责人,将以全职身份领导 Suno 打造面向更广泛受众的音乐未来。
Arvind Narayanan 等人分析英国 NHS 肝移植匹配算法 TBS,指出其用 5 年生存期封顶计算移植收益,导致年轻患者无论病情多重都难以获得高分,2024 年 The Lancet 研究确认了这一年龄偏差。
推荐理由:原文用英国肝移植算法的年龄偏差案例,指出目标变量错配而非输入特征才是算法公平的关键,可迁移到其他预测决策系统。
Suno 发布新功能 Personas,可提取并保存歌曲的人声、风格和氛围,将其应用到新创作中。功能目前以早期测试版向所有 Pro 和 Premier 订阅者开放,附赠 200 首用 Personas 制作的歌曲,之后每首消耗 10 credits;支持设为 Public 供他人使用并链接回创作者主页。
Suno 宣布与 Audible Magic 合作,将后者的内容识别技术直接集成到用户上传流程中,以阻止未经授权的用户上传。该技术服务于 Suno 的 Audio Inputs 与 Covers 功能,用户可上传自己的原创作品或手机上的小样来生成歌曲。Suno 联合创始人兼 CEO Mikey Shulman 称 Audible Magic 是版权合规的可信合作伙伴。
Suno 发布新功能 Suno Scenes,将用户拍摄的照片和视频转化为歌曲,提供视觉叙事的歌曲创作方式。该功能先向 iOS 移动端用户开放,在应用的 Camera 模式下即可使用。
微软 AI 发布 Copilot 应用,其 discover feed 体验整合了学习、探索与放松功能。微软 AI CEO Mustafa Suleyman 表示,Copilot 能理解用户生活语境,同时保护隐私、数据与安全,并记住最有帮助的细节。它还能提供知识获取,简化日常信息轰炸,并在用户需要时给予支持与鼓励。
Suno 推出首个校园大使项目 Sunoversity,招募在校本科生和硕士生担任 University Growth Specialist,申请将于 2024 年 10 月 13 日截止。入选者可免费获得 Suno Premier、优先测试新功能、获得独家周边,并与 Suno 创始人及领导者合作。
Suno 推出早期测试版新功能 Covers,可将语音备忘录或完整曲目转换成不同风格,同时保留原旋律。功能目前面向 Pro 和 Premier 订阅用户开放,每人有 200 次免费额度,之后每次生成消耗 10 credits;beta 阶段可能出现返回原片段未换风格等问题,官方征集用户反馈。
Suno 与 Flosstradamus 合作举办首届混音大赛,参赛者需基于 Soundclash 的 stems 创作混音作品并设为公开,比赛从 9 月 10 日持续至 9 月 30 日。500 名获奖者将分享超 10 万美元现金奖,冠军独得 2.5 万美元,Flosstradamus 还将选出一名个人最爱,将其创作者及同伴送往 10 月 4 日纽约演出同台表演。
DeepSeek 将 DeepSeek V2 Chat 与 DeepSeek Coder V2 合并升级为 DeepSeek V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问新模型。
推荐理由:原文来自官方更新日志,给出了合并后的模型名称、API 兼容方式和多项评测分数变化,便于读者对照评估升级效果。
Suno 公布 Summer of Suno Vol. 2 获奖名单,200 名获奖者共获得 10 万美元奖金。活动历时两周,收到大量用 Suno 创作的音乐视频投稿,官方称投稿的原创性与情感表达超出预期,并预告 Vol. 3 即将公布。
PromptArmor 披露 Slack AI 存在间接提示词注入漏洞,攻击者在公开频道发布恶意指令,即可诱使 Slack AI 将用户私有频道中的 API 密钥等敏感数据嵌入钓鱼链接并渲染给用户,且引用不显示攻击者消息导致难以追踪。
推荐理由:原文给出了完整的攻击链和可操作的缓解设置,读者可以据此评估自己工作区里 Slack AI 的暴露面。
DeepSeek API 创新采用硬盘缓存技术,价格再降一个数量级。更新详情见官方文档 API 上线硬盘缓存,发布于 2024/08/02。
推荐理由:官方宣布 API 采用硬盘缓存并称价格再降一个数量级,读者可以据此评估调用成本的下降幅度。
Suno 发文回应 RIAA 代表三大唱片公司于 6 月 24 日提起的版权诉讼,称诉讼在事实和法律上均有缺陷,训练数据来自开放互联网上的中高质量音乐。Suno 还表示已设置阻止上传受版权内容、禁止按艺术家名生成等防抄袭机制,且起诉时双方正进行商业谈判。
推荐理由:Suno 官方回应 RIAA 诉讼,阐述其训练数据立场和防抄袭机制,可了解生成式音乐版权争议一方的核心论点。
DeepSeek API 于 2024/07/25 更新,为 /chat/completions 接口新增 JSON 输出、Function 调用、对话前缀续写(Beta)和 8K 最长输出(Beta)。同时新增 /completions 接口,支持 FIM 补全(Beta)。
DeepSeek 将 deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。此次更新通过 DeepSeek API 提供,具体功能与参数变化未在公告中披露。
Suno 于 7 月 15 日启动 The Summer of Suno, Vol. 2,从 100 万美元创作者奖池中拿出 10 万美元,平均分给 200 位创作者,每人 500 美元。活动持续两周至 7 月 31 日,主题为"打动我们的音乐",要求提交真人出镜的歌曲反应视频,并新增印度、以色列和日本创作者参与资格。
Suno 宣布推出移动 App,用户可用文字生成歌曲、用手机录音转成歌曲,并收听和收藏其他创作者的音乐。目前已有 1200 万人使用 Suno;该应用先在美国 iOS 上线,Android 和全球推广后续推出。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升。
推荐理由:官方给出代码、数学、推理和对战胜率的前后对比数据,读者可以据此评估这次升级的实际幅度。
DeepSeek-Coder 模型升级为 DeepSeek-Coder-V2-0614,代码生成、代码理解、代码修复和代码补全能力显著提升,达到 GPT-4-Turbo-0409 的水平。新版本还具备卓越的数学和推理能力,通用能力与 DeepSeek-V2-0517 持平。
Suno 发布 Audio Input 功能,Pro 和 Premier 用户可上传或录制音频来生成歌曲。音频片段需在 6-60 秒之间,上传后可选择 Extend 设定时间戳、曲风和歌词;版权作品将被阻止上传,含人声的输入保持私密且不可搜索。
Suno 宣布 2024 年剩余时间向创作者累计发放 100 万美元,首期 Summer of Suno Vol. 1 于 6 月 1 日启动,向 6 月最热门的 500 首公开歌曲发放首笔 10 万美元,第一名奖金 1 万美元。排名按播放、点赞和分享综合计算的人气决定,每位创作者限一首歌曲参赛,奖金将在活动结束后 30 天内通过 PayPal 发放。
AI 音乐生成产品 Suno 宣布完成 1.25 亿美元融资,投资方包括 Lightspeed Venture Partners、Nat Friedman 和 Daniel Gross、Matrix 及 Founder Collective。Suno 上线八个月已有 1000 万人使用其产品创作音乐,资金将用于加速产品开发并扩充团队,官方表示未来几周将发布多项重大更新。
推荐理由:融资公告由创始团队自述,写明资金规模、投资方名单和用途,可了解这家 AI 音乐公司的最新进展。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2-0517,指令跟随性能显著提升,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%。
Sam Altman 发文强调 GPT-4o 已免费向 ChatGPT 用户开放,且无广告,呼应其让强大 AI 工具普惠的使命。他称新的语音和视频模式是他用过的最好计算机界面,达到人类水平的响应时间和表现力,体验自然流畅,并展望未来加入可选个性化、访问个人信息和代用户执行操作等能力。
推荐理由:作者本人解释免费开放 GPT-4o 的考量,并给出新语音模式的第一手使用感受,可作官方视角的背景补充。
Microsoft AI CEO Mustafa Suleyman 在 TED 演讲中提出,即便最接近 AI 开发的人也难以准确描述其走向,他用"新数字物种"这一隐喻来聚焦当下这一非凡时刻。演讲后他与 TED 负责人 Chris Anderson 进行了问答。
Suno 发布 v3 模型,称其首个能生成广播级音乐的模型,已在 https://app.suno.ai 向所有用户开放。v3 可在几秒内生成完整两分钟歌曲,改进包括更好的音质、更多风格流派、更少幻觉和更自然的结尾。模型不识别艺术家引用,并采用不可闻水印技术检测 Suno 生成的歌曲,v4 已在开发中。
推荐理由:Suno 官方说明 v3 在音质、风格与提示词遵循上的具体改进,读者可据此对比自己此前的生成体验。
Suno 上线情人节体验,用户回答三个关于对方的问题后,Suno 会生成三首歌,可在 vdaysong.com 免费试用。该体验灵感来自制作混音带(mixtape)的传统,用户还能在社交媒体分享歌曲并 @suno_ai_,有机会赢取一束鲜花和三个月 Premier 套餐。
Descript CEO Andrew Mason 分享了一份内部指南,讲述如何把 Linear 用作团队的工作操作系统。指南建议用 Zapier 把 Slack 收藏消息自动转为 Linear issue,并可用 ChatGPT 将消息摘要压缩到 12 词以内;同时推荐用 Raycast 绑定快捷键实现快速建 issue。
PromptArmor 披露 Writer.com 存在间接提示词注入漏洞,攻击者在网页中用白色隐藏文本注入指令,可让 LLM 将用户上传的敏感文件内容和聊天记录通过 markdown 图片渲染产生的 GET 请求外泄到攻击者服务器。
Linear 将 Similar Issues 匹配功能推向全部工作空间,用 LLM 生成向量嵌入并在 issue 创建、Triage 和支持集成中提示重复或相关 issue。该功能基于 PostgreSQL 的 pgvector 存储与检索向量,按 workspace ID 分成数百个分区并分别建索引,以支撑数千万条 issue 的余弦相似度查询。
OpenAI 用自研强化学习算法 PPO 训练 5 个智能体组成的团队打 Dota,击败了半职业选手。智能体对两周前的旧版本胜率达 90-95%,训练不使用人类对局数据,仅靠自我对弈和人工设计的奖励函数学会游戏。作者认为这说明深度强化学习在算力足够且模拟环境贴合问题时能解决极难问题,有望推广到更像真实世界的场景。
推荐理由:作者作为当事方说明了不依赖人类对局、靠自我对弈训练的路线,读者可以借此理解强化学习对算力和模拟环境的依赖。
Sam Altman 撰文认为人机融合(the merge)不是未来某一时刻的奇点,而是已经开始数年的渐进过程,手机、社交媒体和搜索算法已在影响人的行为与情绪。他称在 OpenAI 工作中最意外的发现是算力增长与 AI 突破高度相关,硬件和 AI 研究人员数量都在指数增长,认为融合可能是避免物种冲突的最佳路径,并呼吁全世界更早认真对待。