跳到正文

全部动态

今日 25 条
9月29日周二
  1. OpenAI News70

    OpenAI 发布 GPT-6.1 Sol,以 Astra 五分之一的价格提供近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,主打编码、计算机使用和专业工作场景,价格为 Astra 标准 API 输入和输出 token 价格的五分之一。

    推荐理由:原文明确了模型定位与五分之一的价格对比,读者可以据此评估在不同工作负载下替换现有模型API的成本空间。

  2. Apple Machine Learning Research45

    Apple 研究:语言模型树结构表达式序列化的通信瓶颈

    Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。

  3. AWS Machine Learning Blog48

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过跨区域推理配置在 bedrock-runtime 端点提供服务,兼容 Responses、Chat Completions 和 Converse API。

  4. Microsoft Research24

    微软研究院亚洲新加坡分院成立一周年:推进前沿 AI 研究、合作与人才培养

    微软研究院亚洲新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自进化诊断智能体,并与 EDB、IMDA 等机构在物流运输、工业 AI 等领域开展合作。

  5. Databricks Blog65

    Databricks 如何让 12,000 名员工在模型发布首日即可用新模型

    Databricks 介绍其通过 Unity Gateway 让全体员工在 Opus 5.5、GPT-6 Sol 和 GPT-Luna 发布首日即获得实验性访问的完整流程:先用实验标签和按用户预算(月度上限、每日 runaway 限额、质量前沿预算、实验预算四类)控制风险,再依据内部基准、用户反馈和 OpenTelemetry 成本追踪评估。

    推荐理由:原文给出企业内部让全体员工 Day 1 用上新模型的完整流程和成本数据,方法可迁移到类似的模型接入评估场景。

  6. Claude Blog44

    Asana 如何用 Claude 打造可训练的人机协作团队

    Asana 让 AI 智能体直接运行在其 Work Graph 模型内,与人类同事一样拥有角色、任务、消息读写和活动流记录,并由 Claude 驱动复杂任务。每个智能体按内容撰写、洞察分析、项目管理等角色预置技能与 Hubspot 等集成,其实际访问权限受触发者权限约束。智能体的共享记忆仅允许管理员和编辑者写入永久记忆,普通成员反馈只作用于当前任务。

  7. Google Cloud: Databases65

    Google Cloud 分析创业公司为何需要在前沿 API 之外搭配 Gemma 4 开源模型

    Google Cloud 发文主张创业公司采用“复合 AI 栈”,用开源的 Gemma 4 处理边缘执行、高吞吐分流、任务微调和垂直场景,把 Gemini 留给复杂推理。

    推荐理由:文章用三个创业案例和四类工作负载说明开源模型与前沿 API 搭配的架构取舍,适合正在做模型选型的团队参考。

  8. Anthropic Research46

    Anthropic 启动新研究:用 Anthropic Interviewer 征集你对 AI 的真实想法

    Anthropic 发起新研究,通过 Anthropic Interviewer 收集人们与 AI 相处的真实经历,参与者可自行决定是否将完整访谈公开,供任何人阅读研究。研究关注最有意义的 AI 体验、希望 AI 改变的现实领域,以及对 AI 公司的期待。此前去年 12 月的同类研究有 81,000 人参与,成果曾用于 Anthropic Institute 议程并在世界经济论坛上展示。

  9. Anthropic Research82

    Anthropic 评测 GLM-5.3:可自主构建端到端漏洞利用且防护易被绕过

    Anthropic 发布对智谱 GLM-5.3 的网络安全能力分析,认为它是首个在无实质防护下开放权重的强网络攻击能力模型,与 NIST CAISI 评估结论大致一致。

    推荐理由:Anthropic 以一手评测数据说明 GLM-5.3 的漏洞利用能力与防护绕过率,并解释攻击者可及性与 Claude 的访问限制差异。

9月28日周一
  1. Hugging Face Blog75

    H Company 发布 Holo4 系列通用计算机操作智能体模型

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两个尺寸,并附带基于 Nemotron 3 Nano Omni 后训练的 Holotron4 Nano。

    推荐理由:官方发布给出了跨 GUI、代码、MCP 和 API 四类接口的统一智能体模型,附基准分数和完整轨迹数据,适合评估开源方案与闭源模型的成本差距。

  2. OpenRouter Announcements61

    OpenRouter 发布 Security Center 集中管理并降低 API key 风险

    OpenRouter 推出 Security Center,可在设置 > Security 下跨工作区查看所有 API key、识别风险 key,并支持一次最多 500 个批量禁用、归档或设置消费上限,所有套餐可用。

    推荐理由:OpenRouter 以自家 85 名员工 1000 多个 key 的审计为参照,介绍了安全中心的清理建议、风险评分和批量操作方法。

9月27日周日
9月26日周六
  1. GitHub Blog · AI & ML60

    GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 提供 canvas 功能,运行 /create-canvas 技能并用自然语言描述工作流、界面操作和 agent 职责三要素,即可生成看板、清单等自定义界面并保存为可共享的 extension。

    推荐理由:官方教程给出从描述到生成可复用 canvas 界面的具体步骤和三个提问框架,读者可以直接照做迁移到自己的工作流。

9月25日周五
  1. GitHub Blog · AI & ML61

    GitHub Copilot 博客:为什么聊天界面往往不是正确的 UI,用 canvas 试试

    GitHub Copilot 博客作者提出聊天(chat)很多时候是错误的 AI 交互界面,介绍 GitHub Copilot app 中的 canvas,它是在应用内运行、无浏览器外壳的全栈小应用,可与 Copilot agent 双向通信。

    推荐理由:作者作为 Copilot 团队成员提出用 canvas 自定义界面替代聊天框,并结合工作流自动化等实例说明何时值得让智能体先造工具。