跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

当前仅显示精选新闻
456条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 241–260 条 · 共 456 条
8月10日周一
  1. 量子位 · 微信公众号79

    Claude Code 5 天后默认启用自动模式,分类器额外 token 开销由 Anthropic 承担

    Anthropic 宣布 5 天后所有 Claude Code 将默认启用自动模式,分类器每次工具调用额外消耗的 token 不再向用户收费。文中数据显示用户对权限提示的拒绝率仅 3%,在 1053 名付费测试者的受控实验里人工拦下危险命令的比例为 13.6%,auto mode 为 89%。

    推荐理由:用受控实验和生产数据对比人工审批与自动模式的拦截率差异,可看清这次默认变更的取舍依据。

8月8日周六
  1. IT Home76

    OpenAI 因网络安全风险延缓 Astra 模型发布

    OpenAI 宣布因网络安全风险延缓 Astra 模型发布,内部与专家评估显示该模型在智能体编程和网络安全领域取得重大突破,并被列为公司首个在网络安全领域达到关键风险级别的模型。

    推荐理由:OpenAI 因 Astra 在网络安全与智能体编程上的能力突破而延缓发布,读者可了解触发关键风险级别的条件与相应管控措施。

8月7日周五
8月5日周三
8月4日周二
  1. Claude YouTube70

    Claude Code 的自动模式如何运作

    Claude Code 的 auto mode 通过一个单独的分类器逐条筛查每个操作,代替用户逐次确认,从而减少打断、完成长时间任务。视频解释该分类器的工作方式,以及为什么 Claude 不会批准自己的操作,还介绍了如何按自身环境和团队配置 auto mode,并附有官方博客链接。

    推荐理由:视频拆解 Claude Code 自动模式如何用独立分类器逐条筛查操作,并给出按环境与团队配置的入口。

8月3日周一
  1. AI前线 · 微信公众号78

    阿里正式发布 Qwen3.8,2.4T 规模,自主编程 16 天做出 Hermes Agent 级框架

    阿里巴巴正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4 万亿、激活 95B,采用稀疏 MoE 架构与混合注意力机制,支持视觉理解,上下文长度达 1M Tokens。

    推荐理由:原文给出 2.4T MoE 旗舰模型的参数规模、编程能力表现和 API 定价,便于比较其性价比定位。

  2. Qwen Blog67

    Qwen 发布 Qwen3.8-Max,将首次开源 Max 级模型权重

    Qwen 官方发布 Qwen3.8-Max,称为 Qwen 家族迄今最强模型,参数规模达 2.4 万亿,基于 Qwen3.5 架构,在编码、办公和研究等方面全面提升。官方还将首次开源 Qwen-Max 级模型权重,开放权重定于下周发布。

    推荐理由:Qwen 官方宣布新旗舰模型并开源 Max 级权重,读者可据此关注其编码与协作能力变化。

  3. OpenRouter Announcements68

    OpenRouter 发布 Ori Eval,帮你在自己的代码库里选模型

    OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。

    推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。

8月1日周六
  1. Together AI Blog88

    Kimi K3 开发者完整指南:Together AI 上接入 2.8T 参数开源模型

    Together AI 发布 Kimi K3 开发者指南。Kimi K3 是月之暗面 2.8 万亿参数开源权重模型,首个 3 万亿参数级的开源模型,支持 1M 上下文,在 Together 上以 OpenAI 兼容 API 提供服务。

    推荐理由:Together AI 给出 Kimi K3 的完整接入指南,覆盖推理控制、工具调用、缓存和计费细节,可据此优化实际调用成本。

7月31日周五
  1. DeepSeek68

    DeepSeek 宣布 DeepSeek-V4-Flash 官方 API 正式开启公测,Agent 能力大幅升级,基准成绩远超 V4-Pro-Preview。官方版本原生支持 Responses API 格式并完整适配 Codex,配置详情见官方文档 https://api-docs.deepseek.com/quick_start/agent_integrations/codex。

    推荐理由:官方宣布 V4-Flash 公测上线,Agent 能力大幅升级并原生支持 Responses API,配有与多款模型的基准对比数据。

7月30日周四
  1. Cursor Blog66

    Cursor 团队讲解如何搭建云端智能体开发环境

    Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。

7月27日周一
7月25日周六
  1. Simon Willison77

    Anthropic 发布 Claude Opus 5

    Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,并继续提供价格为基础模型两倍的 fast mode。发布帖提到,它在某个 Frontier-Bench 任务中无法直接查看图纸,于是自建计算机视觉流程,从原始像素中提取几何并重建出完整零件;它在发现安全漏洞方面接近 Mythos 5,但利用漏洞的能力仍明显落后,因为未被训练相关攻击任务。

    推荐理由:文中援引发布帖里的零件重建案例,呈现了模型在缺少直接视图时自行搭建视觉流程的过程。