跳到正文

#安全/对齐

今日 0 条
10月1日周四
  1. Google Cloud: Databases23

    Cloud CISO Perspectives:网络安全初创公司如何赢得CISO青睐

    Google Cloud CISO办公室高级总监Alicja Cade与Nick Godfrey为网络安全初创公司支招,建议通过倾听客户需求、评估AI安全性及拥抱行业监管来赢得CISO信任。文中提到Google for Startups项目四年间已支持超50位网络安全创始人,并给出三条建议:先倾听再设计交付、用专有数据与微调构建技术护城河、警惕并购尽职调查中的常见陷阱。

9月30日周三
  1. Apple Machine Learning Research41

    LLM 条件控制中的有效性-流畅性权衡:一项系统性研究

    Apple 研究团队系统考察了 LLM 条件控制方法在概念注入与移除场景下的表现,发现高效激活引导方法往往以流畅性大幅下降为代价。研究还发现激活引导在指令微调模型上的效果远不如基座模型,而提示词与监督微调适合概念注入却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。

9月29日周二
  1. Hugging Face Blog49

    Hugging Face 发布 ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实真实但被归因到错误来源的问题。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中取得最高分。

  2. Anthropic Research46

    Anthropic 启动新研究:用 Anthropic Interviewer 征集你对 AI 的真实想法

    Anthropic 发起新研究,通过 Anthropic Interviewer 收集人们与 AI 相处的真实经历,参与者可自行决定是否将完整访谈公开,供任何人阅读研究。研究关注最有意义的 AI 体验、希望 AI 改变的现实领域,以及对 AI 公司的期待。此前去年 12 月的同类研究有 81,000 人参与,成果曾用于 Anthropic Institute 议程并在世界经济论坛上展示。

  3. Anthropic Research82

    Anthropic 评测 GLM-5.3:可自主构建端到端漏洞利用且防护易被绕过

    Anthropic 发布对智谱 GLM-5.3 的网络安全能力分析,认为它是首个在无实质防护下开放权重的强网络攻击能力模型,与 NIST CAISI 评估结论大致一致。

    推荐理由:Anthropic 以一手评测数据说明 GLM-5.3 的漏洞利用能力与防护绕过率,并解释攻击者可及性与 Claude 的访问限制差异。

9月25日周五
  1. GitHub Blog · AI & ML63

    GitHub Security Lab 发布 Fuzzing Taskflow:用 LLM 智能体自动化 C/C++ 模糊测试

    GitHub Security Lab 的 Antonio Morales 基于自家的 Taskflow Agent 框架构建了 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。

    推荐理由:原文给出完整的架构设计、覆盖反馈循环和分层判断方法,读者可以据此把 LLM 智能体接到自己的模糊测试流程里。

9月24日周四
9月23日周三
9月22日周二
  1. Anthropic Newsroom90

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,官方称其表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 价格为 $4 和 $20 每百万,缓存读取 $0.20 每百万(降低 60%),输出速度快 30% 以上。

    推荐理由:官方给出完整基准、价格与安全评估细节,读者可据此比较 Opus 5.5 在成本与智能体编码上的实际变化。

9月21日周一
9月18日周五
  1. Anthropic Newsroom61

    Anthropic 与 Accenture 合作开展嵌入式评估,双方各投入至少 10 亿美元

    Anthropic 宣布与 Accenture 合作,由其旗下 AI 业务 Faculty 在公司内部开展前沿 AI 的独立评估,包括模型评估与红队测试、对齐评估和安全防护测试,双方各自计划在未来五年至少投入 10 亿美元。

    推荐理由:原文来自当事方,说明了嵌入式评估的运作方式、资金安排与局限,读者可据此理解这一安全机制的边界。

9月17日周四
9月16日周三
  1. Runway News40

    Runway 详解实时视频生成的同步审核系统

    Runway 为即将发布的实时视频生成模型设计了同步审核系统,采用 Zentropi 的 CoPE-B 模型,安全审查平均耗时不到 0.5 秒,可将违规内容暴露窗口压缩至半秒以内。CoPE-B 是基于 Gemma-4-26B-A4B-it 的 LoRA 适配器,该 MoE 模型总参数 25.2B、每次前向仅激活 3.8B,兼顾速度与准确率。实时模型输出将附带 C2PA 溯源信号。

9月15日周二
9月14日周一