跳到正文

#Anthropic

今日 7 条
今天10月2日周五
  1. Rohan Paul59

    Rohan Paul 评论称规则型工作不再是职业而是一条提示词,人类在规则型职业中成了慢、贵、易错的一方。其引用的研究显示前沿模型在中长度、定义清晰的会计任务上已快于且更准于初级会计师,Claude Opus 5 在任务上 20/20 全对且数分钟完成,而 12 名持证 CPA 得分在 0% 到约 90% 之间,多人未能在 3 小时内完成;图中还显示每达成一条评分标准 Claude 成本 $0.21,无 AI 会计师为 $10.35。

    引用Ethan Mollick@emollick

    “We find that on medium-length, well-defined accounting tasks, frontier AI models are now faster and more accurate than junior accountants, even the best one in our study.” Eighteen months ago they scored well below human accountants Good discussion here: https://www.mercor.com/blog/human-baselines-for-benchmarks-ai-now-outperforms-junior-accountants/

  2. Rohan Paul35

    黑石集团总裁兼首席运营官乔恩·格雷几个月前也表达了同样的观点。 任何基于规则的业务,如会计、法律、金融,都将被AI彻底颠覆。🎯 例如:摩根大通在股东投票中弃用代理顾问,改用AI替代。

    引用Rohan Paul@rohanpaul_ai

    Rule-based work isn't a career anymore. It's a prompt. In every rule-based profession, humans are now the slow, expensive, error-prone option. Claude Opus 5 got 20 for 20 at 100% and wrapped each task in minutes, while 12 licensed CPAs landed anywhere from 0% to about 90%, with several running out the 3-hour clock.

  3. AI as Normal Technology60

    Arvind Narayanan 论 AI 安全运动应选大帐篷还是小帐篷

    Arvind Narayanan 提出 AI 安全存在两种叙事之外的第三种可能:x-risk 警告是真诚但错误的,且对安全政策适得其反。文章以疫情防范不足和网络安全系统性风险为例,论证世界确实对 AI 放大的灾难性和累积性风险投入不足,但 x-risk 框架会加剧党派极化并把资源导向不可行的禁令式政策。作者主张建设包容具体风险防御、社会韧性与透明度、问责政策的大帐篷安全运动。

  4. Chubby♨️59

    作者引用 Epoch AI 的 Epoch Capabilities Index 数据:Claude Opus 5.5 以 167 分登顶,略高于 GPT-6 Astra;Claude Sonnet 5.5 大致追平 Claude Fable 5.1(165 分)。作者评论称 Anthropic 的中档模型在发布几个月内就达到旗舰水平,并表示很期待 Fable 5.5。榜单见 epoch.ai/eci。

    引用Epoch AI@EpochAIResearch

    Claude Opus 5.5 has taken the top spot on the Epoch Capabilities Index (ECI) with a score of 167, narrowly ahead of GPT-6 Astra. Claude Sonnet 5.5 has roughly matched Claude Fable 5.1 (165).

10月1日周四
  1. AYi49

    2026年10月1日新加坡早报头版记录了一场闭门午餐会,特朗普居中,两侧为马斯克与黄仁勋,扎克伯格、纳德拉、贝索斯、皮查伊、布罗克曼、阿莫代、卡普及多位美国部长级官员同席。推文称这十几人掌握全球95%以上前沿算力与最顶尖闭源模型,并围绕自愿安全协议、数据中心与能源基建扩张、以及99%世界被挡在规则之外三个维度展开分析。

    引用AYi@AYi_AInotes

    卧槽真的有点细思极恐兄弟们,1971 年美元和黄金脱钩,人类货币花了 50 年从黄金信用走向国家信用,而过去一周,另一场更狠的货币换轨已经悄悄打响了, 我研究完发现,这简直就是一套直接动了传统金融老本的资产大搬家阳谋,我花了3哥多小时研究和做视频,争取把这套可能影响未来 10 年资产规则的底层逻辑一次给大家讲透,大家一定要看, 关于全球金融轨道到底怎么变,OKX 官方最近放出的这张海报和背后的一系列动作,大家一定要知道~! 他们发了一张极简海报:一张 20 美元的纸币,右半边溶解碎成了 01 二进制代码,配文只有一句话:「The New Money Era is exclusively onchain.(新货币时代,只在链上发生)」。 更绝的是,他们的官方账号简介已经悄悄把“Crypto Exchange(加密交易所)”删除了,直接改成了“The New Money App(新货币应用)”。 我一句话给大家概括它的核心本质: 首先这绝不是一句务虚的营销口号,也不是在喊“加密货币要消灭法币”,而是全球金融结算轨道的一次大换轨——真实世界里的股票、美债、黄金和外汇,正在被大面积搬到 24/7 的链上统一订单簿, 说白了,谁能成为这个“新钱世界”的总枢纽,谁就是下一代的全球金融基础设施。 做过全球资产配置和跨境贸易的人,应该都懂那种被旧体系卡脖子的窒息感: →周五下午一过全球股市直接打烊,遇到突发事件只能干瞪眼; →跨国汇一笔款要在中间行里转两三天,被层层手续费抽水; →股票、外汇、黄金、加密资产分散在 5 个不同的软件里,保证金根本无法打通。 当大家以为 Web3 还停留在炒空气币和 meme 的内卷中时, 顶级大厂已经开始用链上轨道对传统金融进行“降维改造”。 我把这个大战略里最值钱的精髓,拆成三个核心维度用大白话给大家讲透: 第一个,生产力底座: 从“纸上信用”到“代码状态”(The Programmability of Money) 为什么海报偏偏选了 20 美元? 因为 20 刀上印着的是安德鲁·杰克逊总统,美国历史上最著名的“反中央银行”斗士,上面还印着“此纸币为法定偿付手段”。 右边溶解成 01 二进制,点破了记账方式的根本性升级: 从前依赖“印在纸上的国家承诺与中介清算”, 现在变成“写在公开链上的可编程代码”。 正如 @a16z 指出的底层规律:区块链创造的是净新增市场。 它拿掉了上市委员会、营业时段和地理国界的物理闸门,让任何资产都能 24/7 流转、自由组合,并被未来的 AI Agent 随时调用。 而所谓新货币,不是只有比特币才是钱,而是全人类的真实资产开始借链上路。 第二个,交易机制演进律: 从割裂市场到“全天候统一订单簿” 过去几百年, 金融市场是按资产类别和地理割裂的:买美股去美股券商,买黄金去期货交易所,换外汇去银行。 而 OKX 正在做的事情,是把它们彻底揉进同一个全天候结算池: ▫️24/7 股票永续与代币化资产: 传统闭市时间照样能交易美股映射头寸,宏观对冲不再受开盘时间限制; ▫️统一保证金与智能组合: 股票、黄金、稳定币、生息资产放在同一个账户内互相质押调用; ▫️中心化性能 + 链上结算: 撮合用极速的中心化引擎,资产结算与持有靠自托管钱包和 L2(X Layer)完成。 它不是原教旨的纯链上低效撮合,而是兼顾极速交易体验与链上资产透明度的工业级打法。 第三个,商业闭环与权力重构: 从“炒币通道”到“新钱总入口” 为什么顶级平台要主动撕掉“交易所”的标签? 因为单纯撮合买卖的交易通道,天花板肉眼可见; 但如果成为掌控支付、结算、理财与跨资产调度的“新货币超级入口”,天花板将是整个全球经济体量。 从自研 L2 基础设施,到欧洲上线 50 万欧资产保障(Shield),再到零手续费的稳定币支付网络, 这家公司的战略意图极其清晰: 用一条链上高速公路,把现实世界的资金吸纳进来, 做成不可逆的结算闭环。 历史规律与真实数据的硬核印证: ▫️清算规模的历史反超: OKX 披露的数据显示,全球稳定币的年结算量已经突破数万亿美元,在规模和流速上正式跨入 Visa 等传统巨头的量级; ▫️用户基建的指数增长: 全球链上独立钱包数已突破 5 亿个,钱的载体正在从银行账户不可逆地向自托管钱包迁移; ▫️大厂动作的精准收网: 9 月 27 日上线 24/7 代币化股票,同周在德州与欧洲推进合规支付,10 月 6 日在新加坡召开 OKX Now 发布会,把这套世界观全盘落地成订单流。 当然,照例泼三盆冷水,大家看清口号背后的现实边界: ▫️“Exclusively Onchain”在现实监管下依然有距离:代币化美股交易的是映射仓位,底层依然受发行地、托管方和白名单限制,绝非纽交所本身被完全搬上链; ▫️中心化撮合的本质未变: 撮合系统、风控逻辑与法币进出依然由中心化机构掌控,它提供的是“交易所级别的 Onchain”,不能与纯去中心化协议混为一谈; ▫️商业利益与自托管的拉扯: 官方一边宣传自托管钱包,一边用高息理财、跟单和 VIP 权益把资金沉淀在平台内部,双轨并行才是真实商业。 最后小结一下,纸币碎成 01 代码,不是美元的末日,而是全球金融基础设施的换代。 当一家行业霸主主动抹去“交易所”的标签, 它瞄准的已经是未来几十年 50% 全球经济活动上链的大浪潮了。 兄弟们觉得未来 3–5 年内,你手上配置的美股、基金或外汇, 会逐步搬到 24/7 的链上账户里去交易吗?评论区聊聊呀~

  2. 赵纯想38

    赵纯想指出,Opus 5.5 生成的精美视频第一天被欢呼、第二天被复刻、第三天便索然无味,原因是 Skill 的分发把差异拉平,而差异正是“力”与利润率的来源。他引用红果短剧数据称,95% 以上的漫剧亏本,头部若干漫剧利润率百分之几万,赚走大部分钱。AI 把个体生产力拉到三年前不敢想象的水平,但盈利仍遵循极致冷酷的大数定律。

    引用赵纯想@chunxiangai

    力,起源于差异。一大一小,两个同样材质的东西,能在人脑中映射出“压迫感”。这个压迫感,就是力。把房子建在房子群落中,房子就不够有力。把房子建在旷野上,方圆百里,没有其他房子,这个房子就有力。力,就是差异。 有了力,就有了结构。一大一小,就是一种结构。荒野上的孤独的房子,就是结构。结构就是稳态的差异。海浪也有差异,但不稳定。海浪,不是结构。结构若想稳定存在,就要形成系统。系统保存着结构,结构保存着差异,差异,保存着力。 少部分人,发抖音。大部分人,刷抖音。 一少一多,就有力。 少部分人,购买奢侈品。奢侈品每年花大价钱,买最大的广告牌,让大部分人看到、得知它的贵重。 一多一少,就有力。 越有力的系统,结构上的差异越大。女人,细枝挂硕果,最有力。男人,毛发旺盛,但粉鸡巴,最有力。 结构上的差异越大,包含这个结构的系统,就越难以自持。抖音,通过算法控制,来维系力。让少部分精彩视频,被分发给大部分人。一多一少,让力释放其价值。没有推荐算法,任由内容传播,会使得精彩和平庸混为一谈,那是对力的亵渎。 越难自持的系统,就需要越强的外部能量的控制。在强力的控制下,围绕力,释放价值,价值反哺外部能量,实现自持。如同涡扇发动机,进入自持,需要外部能量的点火激励。 用草纸,画出一个二八定律下的结构,一个有力的平台,便被描绘出来。少部分人,做什么。多部分人,做什么。一多一少,一薄一厚,一尖一盾,就形成力。有力,就有价值。结构,保存力,等同于保存价值。系统,组织结构,让价值可视、可流转、可维护。 大而全,是亵渎力。小而美,是小的力。大而精,最有力。力在悬殊中,力在差异里。

9月30日周三
  1. Gary Marcus51

    Gary Marcus 批评白宫《超级智能协议》是弱约束的自查承诺

    Gary Marcus 评论白宫《超级智能协议》,认为其实质是签署企业承诺不受监管、不让公众发声、只靠自律的弱约束文本。他质疑协议中独立外部审计的独立性可能受大公司选择和业务关系影响,并指出两周前业内谈论的 AI 发展限速已不见踪影,称 Dario、Sam 和 Elon 都退缩了。

9月29日周二
  1. Claude Blog44

    Asana 如何用 Claude 打造可训练的人机协作团队

    Asana 让 AI 智能体直接运行在其 Work Graph 模型内,与人类同事一样拥有角色、任务、消息读写和活动流记录,并由 Claude 驱动复杂任务。每个智能体按内容撰写、洞察分析、项目管理等角色预置技能与 Hubspot 等集成,其实际访问权限受触发者权限约束。智能体的共享记忆仅允许管理员和编辑者写入永久记忆,普通成员反馈只作用于当前任务。

  2. Anthropic Research82

    Anthropic 评测 GLM-5.3:可自主构建端到端漏洞利用且防护易被绕过

    Anthropic 发布对智谱 GLM-5.3 的网络安全能力分析,认为它是首个在无实质防护下开放权重的强网络攻击能力模型,与 NIST CAISI 评估结论大致一致。

    推荐理由:Anthropic 以一手评测数据说明 GLM-5.3 的漏洞利用能力与防护绕过率,并解释攻击者可及性与 Claude 的访问限制差异。

9月28日周一
9月27日周日
9月24日周四
9月23日周三
9月22日周二
  1. MIT Technology Review · AI49

    别被这个夏天的 AI 炒作忽悠了

    针对今夏一系列 AI 炒作事件,DAIR 执行总监 Timnit Gebru 指出,Anthropic 与 OpenAI 宣称的漏洞发现、数学突破等成果在专家核查后均大幅缩水,OpenAI 的数学成果还被数学家指控剽窃他人工作。她认为"超级智能"叙事源于超人类主义等意识形态,把智能体说成"失控模型"实为帮企业逃避责任,呼吁政策制定者听取独立专家意见、不要依赖新闻稿。

9月21日周一
  1. Simon Willison44

    工程师爆料:大公司全员用 Claude Code 生成代码,无人阅读

    一名新入职大公司半个月的工程师称,团队所有规格、代码、测试、PRD、工单及其解决方案、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。团队无人喜欢这种做法,却被要求尽可能多地产出,高层多次表示推代码不是瓶颈,质疑为何还是慢,员工每天工作 12 到 13 小时只为按回车,没有人阅读任何内容。

  2. Peter McCrory38

    大体同意。一些实际启示: (1) 优先做能用新数据定期更新的分析 (2) 公开地做研究(根据新证据修正自己的观点) (3) 承认不确定性;做出可证伪的预测 (4) 真诚且谦逊

    引用Alex Imas@alexolegimas

    A few (personal) thoughts on reading empirical AI papers on the economy. Economists have gotten used to reading papers with super clean identification, arguing about the validity of an instrument, making sure parallel trend assumptions are satisfied. This is what gets you into a top journal, and it is *very* important research (no question here). But it also takes years and sometimes decades to get these types of papers right---people often don't find a good instrument to answer a specific causal question decades after the natural experiment. We will eventually have this type of research for AI as well, and it is absolutely necessary. But right we also need signals *right now*, even if they are noisier than what we are used to. We need papers where we can trust that researchers did their best methodologically, while at the same time acknowledging that the space is moving way too fast to wait for perfect identification. This will allow us to accumulate enough signals, coming at the same question using different angles, for example, to say "yes, X is likely happening in the economy". The AI exposure and early career hiring papers are a good example of this. There is no silver bullet paper with super clean identification. But at this point we have several independent teams reaching the same general conclusion, enough where we can say "there seems to be a slow down in AI-exposed, early career hiring."

9月19日周六
9月18日周五
9月17日周四
9月16日周三