Mistral AI 开源 3B 多模态安全分类器 Shieldstral
Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。
推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。
推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于更快地发现、验证和修补漏洞。
推荐理由:原文给出基准对比、内部落地和受限开放方式,读者可以据此评估轻量安全模型在漏洞发现中的取舍。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。
推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。
推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。
Arvind Narayanan 等人分析英国 NHS 肝移植匹配算法 TBS,指出其用 5 年生存期封顶计算移植收益,导致年轻患者无论病情多重都难以获得高分,2024 年 The Lancet 研究确认了这一年龄偏差。
推荐理由:原文用英国肝移植算法的年龄偏差案例,指出目标变量错配而非输入特征才是算法公平的关键,可迁移到其他预测决策系统。
Suno 发文回应 RIAA 代表三大唱片公司于 6 月 24 日提起的版权诉讼,称诉讼在事实和法律上均有缺陷,训练数据来自开放互联网上的中高质量音乐。Suno 还表示已设置阻止上传受版权内容、禁止按艺术家名生成等防抄袭机制,且起诉时双方正进行商业谈判。
推荐理由:Suno 官方回应 RIAA 诉讼,阐述其训练数据立场和防抄袭机制,可了解生成式音乐版权争议一方的核心论点。