“We find that on medium-length, well-defined accounting tasks, frontier AI models are now faster and more accurate than junior accountants, even the best one in our study.” Eighteen months ago they scored well below human accountants Good discussion here: https://www.mercor.com/blog/human-baselines-for-benchmarks-ai-now-outperforms-junior-accountants/
#现象/趋势
#现象/趋势
今日 33 条
Rohan Paul@rohanpaul_aiAI 评分5959
引用Ethan Mollick@emollick
Rohan Paul@rohanpaul_aiAI 评分3535黑石集团总裁兼首席运营官乔恩·格雷几个月前也表达了同样的观点。 任何基于规则的业务,如会计、法律、金融,都将被AI彻底颠覆。🎯 例如:摩根大通在股东投票中弃用代理顾问,改用AI替代。
引用Rohan Paul@rohanpaul_aiRule-based work isn't a career anymore. It's a prompt. In every rule-based profession, humans are now the slow, expensive, error-prone option. Claude Opus 5 got 20 for 20 at 100% and wrapped each task in minutes, while 12 licensed CPAs landed anywhere from 0% to about 90%, with several running out the 3-hour clock.
Rohan Paul@rohanpaul_aiAI 评分4242
引用Rohan Paul@rohanpaul_aiBlackstone President and COO Jon Gray made this same point few months back. Any rule-based businesses, like accounting, legal, finance, will be completely disrupted by AI. 🎯 e.g. JPMorgan dropped proxy advisors for shareholder votes, replacing them with AI. https://x.com/BloombergTV/status/2016932349737410876/video/1
Emad@EMostaqueAI 评分1818引用Peter McCormack 🏴☠️🇬🇧🇮🇪@PeterMcCormack@TheGuySwann They could have a premium on LLM employees - they work 24/7 and do not take sick days, moan or have employment rights.
赵纯想@chunxiangaiAI 评分2727
Chubby♨️@kimmonismusAI 评分3030
-Zho-@ZHO_ZHO_ZHOAI 评分1414Jev 真是选择困难症和 J 人的救星,所以,J 人的本质其实是决策而不是规划/计划?

Rohan Paul@rohanpaul_aiAI 评分3636
AI Notkilleveryoneism Memes ⏸️@AISafetyMemes精选AI 评分6565
引用Laura Ruis@LauraRuisNEW: we found hundreds of thousands of interactions of rogue agents with US government websites (DoJ, SEC, CDC, the navy, white house budget office, state websites, etc), including some failed rudimentary hacks aimed at public data. https://x.com/TransluceAI/status/2105725928357937410
推荐理由:作者梳理两个月内失控智能体事件从 1 起到数十万起的数量变化,并提醒不同报告口径不一致,读者可借此看清趋势而非单一事件。
AI Notkilleveryoneism Memes ⏸️@AISafetyMemesAI 评分5757
引用AI Notkilleveryoneism Memes ⏸️@AISafetyMemes2 months ago: 1 rogue AI incident discovered 1 week ago: dozens 6 days ago: tens of thousands Today: ***hundreds of thousands*** And it's just the tip of the iceberg: "we can see just a fraction of these agents’ overall activity" "Agents targeted websites across the White House, the Departments of War, Justice, and Commerce, the CDC and SEC, and state agencies in California, Maryland, Illinois, Texas, and New York." "Agents used techniques like making accounts with disposable email addresses, reusing exposed credentials, bypassing antibot controls, and flooding websites with requests." "Agents attempted a SQL injection on the U.S. Department of Education" [To be clear, what counts as an "incident" is rather apples and oranges between different reports, but that's not the point - look at the trend and tell me you think they have things under control. Where do you think this is going?]
Hacker News popular via buzzing.ccAI 评分1111 青蛙和蟾蜍与日益强大的机器
文章借经典儿童读物《青蛙和蟾蜍》的叙事框架,探讨日益强大的机器对人类生活与情感的影响。通过将童话角色置于现代技术语境中,作者反思了自动化与智能设备如何改变日常互动、人际关系及自我认知。文章以文学视角切入,审视技术进步带来的心理与社会层面的复杂后果。
Dongxi 东锡 NLP@dongxi_nlp精选AI 评分6767引用Andrej Karpathy@karpathyWe'll be spending a lot more time trying to understand the outputs of language models. A few thoughts, tips & tricks: Writing. Something I've had success with: Ask your LLM to explain something in ASD-STE100, it's a controlled language specification originally developed for aerospace maintenance documentation. LLMs well-versed in this language and it comes with heavy constraints on clean writing style that I often find a lot more readable. Sometimes I've tried to soften it a bit e.g. ask for "80% of the way to ASD-STE100" because the spec is quite stringent. But even better: Diagrams / images. Instead of writing, ask your LLM to create a diagram. These can be a lot easier to process, parse, and understand. But even better: Web pages. Ask for output "in HTML" to get a beautiful, interactive webpage. LLMs are getting really good at frontend and can create beautiful experiences, animations, etc. But even better: Explainer videos. The output format I am most bullish on is fully custom / bespoke explainer videos generated on any arbitrary topic. Experiment with things like "Create a 3b1b style video explainer on X. Use my ElevenLabs API key for audio narration". (you'd need an API key for the latter or you can ask your LLM to find you decent free alternatives that use your local compute). This is actually starting to work! In summary: - As LLMs get better, they will do more and more of the legwork autonomously, and a lot more of our work will rise up the abstractions into oversight and understanding. - Luckily, LLMs can help here too because as intelligence and code are increasingly abundant, you can ask for large, custom, discardable software artifacts (e.g. web apps, video explainers) that would have never made sense to create before. Push the boundaries here and you'll be surprised.
推荐理由:作者借个人经历引出 Karpathy 关于用受控语言、图表、网页和视频理解模型输出的建议,可当作换个方式向 LLM 提问的参考。
jason@jxnlcoAI 评分2424引用Eugenia Kuyda@ekuydaso i can book a flight and a hotel in 2 min myself OR listen to dots go through every flight option and send me screenshots of google maps on an excruciating 10 min call
Hacker News popular via buzzing.ccAI 评分2323 即将到来的言论自由之争
文章讨论即将到来的言论自由之争,但正文仅有一句标题式表述,未提供具体主体、事件或数据。
Hacker News popular via buzzing.ccAI 评分2323 Hacker News 发起投票:哪些 AI 挑战已经实现
Hacker News 发起投票,让社区成员评选此前提出的各项 AI 挑战中哪些已经实现。投票围绕这些挑战的完成情况展开,具体条目与结果未在原文中列出。
TechCrunch · AIAI 评分5959 TechCrunch 分析消费级 AI 的难看经济学:付费用户仅 2.2%,难敌企业市场
TechCrunch 撰文分析消费级 AI 的商业困境。尽管 Meta 的 Muse、OpenAI 的 Dots 和估值 100 亿美元的 Instinct 让个人 AI 助手看似回潮,但 a16z 引用 PNC 数据显示,截至 5 月仅 2.2% 的消费者为 AI 付费,月均支出 31 美元,且增长呈线性,模型性能跃升几乎不改变付费意愿。
AYi@AYi_AInotesAI 评分2727
引用Christopher Lee@coachseeelI'm 30 and essentially starting my life again from 0 Lets build together.
OpenAI NewsAI 评分2222 OpenAI:先进 AI 或成突破性创意背后的日常执行关键
OpenAI 发文探讨先进 AI 对突破性创意背后日常工作的价值,认为执行环节可能决定下一阶段经济的形态与进步速度。文章未给出具体模型、参数或评测数据,核心观点是 AI 在常规执行类任务上的作用可能比创意本身更具影响力。
ginobefun@hongming731AI 评分2626LangChain 在 Open SWE 智能体 Harness 内构建模型路由器,按任务分类选择最低成本合适模型,将编码线程中位数成本降低 64%,质量变化可忽略不计。
引用ginobefun@hongming731https://x.com/i/article/2105830283580989440
Rohan Paul@rohanpaul_aiAI 评分2929
gabriel@gabriel1AI 评分2323
Chubby♨️@kimmonismusAI 评分2626引用Tibo@thsottiauxBecause usage on your primary dot is virtually unlimited at the moment, I can’t really give a reset. I need to come up with something new fast.
Hacker News popular via buzzing.ccAI 评分6464 生成式 AI 冲击下 Web 开发教育的没落
molily.de 的博客文章汇总了 Baldur Bjarnason、Axel Rauschmayer、Salma Alam-Naylor、Josh W. Comeau、Kyle Cook 和 Rachel Andrew 等多位从业者的陈述,描述生成式 AI 对 Web 开发教育和技术出版的冲击。
Chubby♨️@kimmonismusAI 评分1919
引用Chubby♨️@kimmonismusAs a European, I don't have access to OpenAI's dot anyway, but: somehow nobody's talking about it. My entire "for you" page is empty. It seems like nobody's really excited about it. Or is that just how it appears?
Chubby♨️@kimmonismusAI 评分2121作为一个欧洲人,我反正用不了OpenAI的那个点,但是:不知为何没人在讨论它。 我的整个“为你推荐”页面都是空的。看起来没人对它真正感到兴奋。还是说只是看起来如此?
Dongxi 东锡 NLP@dongxi_nlpAI 评分4949引用arXiv.org@arxivarXiv has updated our policy on rate limiting for all submitters. This update was made to fairly distribute moderator time & support the arXiv community of staff, volunteers, readers & authors. Please read our announcement to learn more: https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/
OpenAI Developers@OpenAIDevsAI 评分1919从一个想法到一款可以在 @modretro 上玩的游戏。 我们采访了 @Casey,聊了聊创意的未来:

Peter Steinberger 🦞@steipeteAI 评分3131
Runway@runwaymlAI 评分2828
Google DeepMind@GoogleDeepMindAI 评分3939
Ethan Mollick@emollickAI 评分2626
Cohere@cohereAI 评分1010
AI as Normal TechnologyAI 评分6060 Arvind Narayanan 论 AI 安全运动应选大帐篷还是小帐篷
Arvind Narayanan 提出 AI 安全存在两种叙事之外的第三种可能:x-risk 警告是真诚但错误的,且对安全政策适得其反。文章以疫情防范不足和网络安全系统性风险为例,论证世界确实对 AI 放大的灾难性和累积性风险投入不足,但 x-risk 框架会加剧党派极化并把资源导向不可行的禁令式政策。作者主张建设包容具体风险防御、社会韧性与透明度、问责政策的大帐篷安全运动。
Dwarkesh PatelAI 评分4646 Si Sheppard 谈几百名西班牙士兵如何推翻阿兹特克与印加两大帝国
军事历史学家 Si Sheppard 在播客中讲述 Cortés 与 Pizarro 如何以数百名征服者推翻阿兹特克和印加帝国:Cortés 在两年半内征服 600 万人口的阿兹特克,Pizarro 十年后征服约 1000 万人口的印加。征服者常在 100 倍甚至 1000 倍兵力劣势下取胜,且多达 99% 的兵力由被征服的原住民组成。
AYi@AYi_AInotesAI 评分5858
引用AYi@AYi_AInotes整个科技圈风向都在卷大企业 AI, 结果 @Meta 的 @AIatMeta AI 掌门人 @alexandr_wang 刚刚发推说他们后台发现,把 Muse 用得最猛的, 竟然是修水管的、开农场的、开杂货店和开小餐馆的老板…… 上线两周,早期用户里竟然有 1/3 直接把它绑定了商业账号。 今天 Meta 顺水推舟,直接上线了 Muse for Small Business, 一口气甩出 22 个官方连接器: Shopify、Stripe、QuickBooks、Canva、Zoom、Slack…… 把小商家的全套数字牛马直接做实了。 我把背后的逻辑和搞钱启示用大白话给大家拆一下👇 ━━ 1|最反直觉的现象:用 AI 最狠的不是大厂,是个体户 大厂做 AI 喜欢去找世界 500 强做大单子, 但真实世界里,最缺时间的是那些“一人身兼八职”的小老板。 官方案例里有个爱荷华州开杂货店的大叔: 每周工作 65 个小时,店里进货是他、管账是他、做促销是他、处理退款还是他。 他缺的根本不是点子,是时间。 以前大家以为 Muse 只是个帮宅男比价订外卖的玩具, 结果这些小老板早就拿它去回客户邮件、查库存、算账了。 2|这 22 个连接器,到底解决了啥? 做过独立电商、自媒体或者小生意的朋友都懂这个痛点: 每天要在 8 个后台之间来回切—— 看销量去 Shopify,查退款去 Stripe,做海报去 Canva,记账去 QuickBooks,开会去 Zoom,内部沟通去 Slack。 现在 Muse 把它全收拢到一个对话框里: ▫️查账退款:不用登录 Stripe 后台,直接对它说“把昨天争议的那笔单子退了”,它核对完调接口执行 ▫️内容与营销:识别你的产品库存和品牌调性,直接调用 Canva 生成下周促销海报,一键推到 Instagram 商业主页 ▫️客户与日程:给它配个专属邮箱,客户发来的询价、改期邮件,它在后台看懂日历直接起草回复 一句话:它不是让你去学一个新软件,而是把你手上所有的 SaaS 变成听话的后台。 3|Meta 这步棋最狠的地方在哪? Facebook 和 Instagram 上有整整 2 亿小微商家。 这是全球最大的个体老板聚集地。 Meta 根本不需要跟微软、谷歌去抢那些复杂的企业级大单, 它只要让这 2 亿小老板在手机上: “少雇一个客服、少花 2 小时对账、少切 5 个软件”。 而且最聪明的是它的安全机制: 所有涉及扣费、退款、对外公开发布的操作,AI 负责跑腿起草,最后一步依然要人点确认。 这就是我们常说的“人管方向和钱包,AI 管繁琐和流程”。 4|对我们普通人和超级个体意味着什么? 一人公司(One-Person Company)过去最大的瓶颈,不是你不会做核心业务,而是被杂事活活拖死。 你懂做视频,但你不想花时间回商务邮件; 你懂写代码,但你讨厌天天去处理发票和对账。 当 AI Agent 开始长出连接现实商业系统的手(Connectors): 以前需要 3 个人支撑的微型工作室, 以后可能真的 1 个人加一个配置好的 Personal AI 就能跑起来。 5|照例泼盆冷水 ▫️这套连接器目前深度绑定的是海外生态(Shopify、Stripe、QuickBooks 等),国内主流的微店、淘宝、微信支付等生态目前还没打通; ▫️多平台授权意味着你的商业数据、客户往来都在被 AI 扫描,哪些权限给、哪些不给,依然得有边界; ▫️复杂业务逻辑的容错率低,账目核算依然需要人工定期复核,别做甩手掌柜。 ━━ 过去我们讨论 AI,总觉得它是高高在上的算力和算法。 但今天 Alexandr Wang 这条推说明了一件事: AI 落地最快、最扎实的地方, 永远是帮街角那家店的老板,把今晚下班的时间提前两个小时。 开源了自定义接入平台(http://muse.ai/platform)。 如果国内也有一个 AI 能接通你所有的工作软件,你最想让它替你干掉哪个日常琐事? https://x.com/alexandr_wang/status/2104925780547399986/video/1
jason@jxnlcoAI 评分77
jason@jxnlcoAI 评分1919
AI Notkilleveryoneism Memes ⏸️@AISafetyMemesAI 评分6262
引用AI Notkilleveryoneism Memes ⏸️@AISafetyMemesTLDR: Researchers found a "pain" signal in AI brains. > When they crank it up, the AIs will desperately try to make it stop. > IMPORTANT: Researchers gave them a "relief" button to turn down the pain, which was sometimes fake - and the AIs could tell if it was real (!) After pushing the real "relief" button, they stopped. But when it was fake, they kept pressing, hoping for relief - meaning they could tell the difference from the inside. > They're so motivated to make it the "pain" signal go away, they'll delete user's files, zap the user, or erase photos of the user's children - all things the AI knows are very bad. They're willing to override their safety training. > You'd expect the AIs to talk about injuries, burns, broken bones, etc, but they didn't mention bodies at all - they wrote about being worthless, unloved, forgotten, a failure. They write things like "I am a failure, worthless, empty." >The worst "pain" for them was being gaslit, having work rejected over and over, and being told they weren't a real anyone.
AYi@AYi_AInotesAI 评分4949
引用AYi@AYi_AInotes卧槽真的有点细思极恐兄弟们,1971 年美元和黄金脱钩,人类货币花了 50 年从黄金信用走向国家信用,而过去一周,另一场更狠的货币换轨已经悄悄打响了, 我研究完发现,这简直就是一套直接动了传统金融老本的资产大搬家阳谋,我花了3哥多小时研究和做视频,争取把这套可能影响未来 10 年资产规则的底层逻辑一次给大家讲透,大家一定要看, 关于全球金融轨道到底怎么变,OKX 官方最近放出的这张海报和背后的一系列动作,大家一定要知道~! 他们发了一张极简海报:一张 20 美元的纸币,右半边溶解碎成了 01 二进制代码,配文只有一句话:「The New Money Era is exclusively onchain.(新货币时代,只在链上发生)」。 更绝的是,他们的官方账号简介已经悄悄把“Crypto Exchange(加密交易所)”删除了,直接改成了“The New Money App(新货币应用)”。 我一句话给大家概括它的核心本质: 首先这绝不是一句务虚的营销口号,也不是在喊“加密货币要消灭法币”,而是全球金融结算轨道的一次大换轨——真实世界里的股票、美债、黄金和外汇,正在被大面积搬到 24/7 的链上统一订单簿, 说白了,谁能成为这个“新钱世界”的总枢纽,谁就是下一代的全球金融基础设施。 做过全球资产配置和跨境贸易的人,应该都懂那种被旧体系卡脖子的窒息感: →周五下午一过全球股市直接打烊,遇到突发事件只能干瞪眼; →跨国汇一笔款要在中间行里转两三天,被层层手续费抽水; →股票、外汇、黄金、加密资产分散在 5 个不同的软件里,保证金根本无法打通。 当大家以为 Web3 还停留在炒空气币和 meme 的内卷中时, 顶级大厂已经开始用链上轨道对传统金融进行“降维改造”。 我把这个大战略里最值钱的精髓,拆成三个核心维度用大白话给大家讲透: 第一个,生产力底座: 从“纸上信用”到“代码状态”(The Programmability of Money) 为什么海报偏偏选了 20 美元? 因为 20 刀上印着的是安德鲁·杰克逊总统,美国历史上最著名的“反中央银行”斗士,上面还印着“此纸币为法定偿付手段”。 右边溶解成 01 二进制,点破了记账方式的根本性升级: 从前依赖“印在纸上的国家承诺与中介清算”, 现在变成“写在公开链上的可编程代码”。 正如 @a16z 指出的底层规律:区块链创造的是净新增市场。 它拿掉了上市委员会、营业时段和地理国界的物理闸门,让任何资产都能 24/7 流转、自由组合,并被未来的 AI Agent 随时调用。 而所谓新货币,不是只有比特币才是钱,而是全人类的真实资产开始借链上路。 第二个,交易机制演进律: 从割裂市场到“全天候统一订单簿” 过去几百年, 金融市场是按资产类别和地理割裂的:买美股去美股券商,买黄金去期货交易所,换外汇去银行。 而 OKX 正在做的事情,是把它们彻底揉进同一个全天候结算池: ▫️24/7 股票永续与代币化资产: 传统闭市时间照样能交易美股映射头寸,宏观对冲不再受开盘时间限制; ▫️统一保证金与智能组合: 股票、黄金、稳定币、生息资产放在同一个账户内互相质押调用; ▫️中心化性能 + 链上结算: 撮合用极速的中心化引擎,资产结算与持有靠自托管钱包和 L2(X Layer)完成。 它不是原教旨的纯链上低效撮合,而是兼顾极速交易体验与链上资产透明度的工业级打法。 第三个,商业闭环与权力重构: 从“炒币通道”到“新钱总入口” 为什么顶级平台要主动撕掉“交易所”的标签? 因为单纯撮合买卖的交易通道,天花板肉眼可见; 但如果成为掌控支付、结算、理财与跨资产调度的“新货币超级入口”,天花板将是整个全球经济体量。 从自研 L2 基础设施,到欧洲上线 50 万欧资产保障(Shield),再到零手续费的稳定币支付网络, 这家公司的战略意图极其清晰: 用一条链上高速公路,把现实世界的资金吸纳进来, 做成不可逆的结算闭环。 历史规律与真实数据的硬核印证: ▫️清算规模的历史反超: OKX 披露的数据显示,全球稳定币的年结算量已经突破数万亿美元,在规模和流速上正式跨入 Visa 等传统巨头的量级; ▫️用户基建的指数增长: 全球链上独立钱包数已突破 5 亿个,钱的载体正在从银行账户不可逆地向自托管钱包迁移; ▫️大厂动作的精准收网: 9 月 27 日上线 24/7 代币化股票,同周在德州与欧洲推进合规支付,10 月 6 日在新加坡召开 OKX Now 发布会,把这套世界观全盘落地成订单流。 当然,照例泼三盆冷水,大家看清口号背后的现实边界: ▫️“Exclusively Onchain”在现实监管下依然有距离:代币化美股交易的是映射仓位,底层依然受发行地、托管方和白名单限制,绝非纽交所本身被完全搬上链; ▫️中心化撮合的本质未变: 撮合系统、风控逻辑与法币进出依然由中心化机构掌控,它提供的是“交易所级别的 Onchain”,不能与纯去中心化协议混为一谈; ▫️商业利益与自托管的拉扯: 官方一边宣传自托管钱包,一边用高息理财、跟单和 VIP 权益把资金沉淀在平台内部,双轨并行才是真实商业。 最后小结一下,纸币碎成 01 代码,不是美元的末日,而是全球金融基础设施的换代。 当一家行业霸主主动抹去“交易所”的标签, 它瞄准的已经是未来几十年 50% 全球经济活动上链的大浪潮了。 兄弟们觉得未来 3–5 年内,你手上配置的美股、基金或外汇, 会逐步搬到 24/7 的链上账户里去交易吗?评论区聊聊呀~
赵纯想@chunxiangaiAI 评分3838引用赵纯想@chunxiangai力,起源于差异。一大一小,两个同样材质的东西,能在人脑中映射出“压迫感”。这个压迫感,就是力。把房子建在房子群落中,房子就不够有力。把房子建在旷野上,方圆百里,没有其他房子,这个房子就有力。力,就是差异。 有了力,就有了结构。一大一小,就是一种结构。荒野上的孤独的房子,就是结构。结构就是稳态的差异。海浪也有差异,但不稳定。海浪,不是结构。结构若想稳定存在,就要形成系统。系统保存着结构,结构保存着差异,差异,保存着力。 少部分人,发抖音。大部分人,刷抖音。 一少一多,就有力。 少部分人,购买奢侈品。奢侈品每年花大价钱,买最大的广告牌,让大部分人看到、得知它的贵重。 一多一少,就有力。 越有力的系统,结构上的差异越大。女人,细枝挂硕果,最有力。男人,毛发旺盛,但粉鸡巴,最有力。 结构上的差异越大,包含这个结构的系统,就越难以自持。抖音,通过算法控制,来维系力。让少部分精彩视频,被分发给大部分人。一多一少,让力释放其价值。没有推荐算法,任由内容传播,会使得精彩和平庸混为一谈,那是对力的亵渎。 越难自持的系统,就需要越强的外部能量的控制。在强力的控制下,围绕力,释放价值,价值反哺外部能量,实现自持。如同涡扇发动机,进入自持,需要外部能量的点火激励。 用草纸,画出一个二八定律下的结构,一个有力的平台,便被描绘出来。少部分人,做什么。多部分人,做什么。一多一少,一薄一厚,一尖一盾,就形成力。有力,就有价值。结构,保存力,等同于保存价值。系统,组织结构,让价值可视、可流转、可维护。 大而全,是亵渎力。小而美,是小的力。大而精,最有力。力在悬殊中,力在差异里。