跳到正文

现象与趋势

正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。

当前仅显示精选新闻
171条精选相关主题大佬观点行业动态安全对齐

最新精选

第 1–20 条 · 共 171 条
今天10月6日周二
  1. 数字生命卡兹克 · 微信公众号68

    A16Z 两份 AI 报告解读:付费率仅 4.5%,重度用户与杰文斯悖论

    作者解读 A16Z 第七版《Top 100 消费级 AI 应用》与 90 多页的《市场状况 II》报告。截至 2026 年 8 月,美国仅 4.5% 的人订阅 ChatGPT、Gemini 或 Claude,98% 的家庭未为 AI 付费;头部 1% 付费用户月均消费 903 美元,贡献 19.5% 的总消费。

    推荐理由:作者拆解 A16Z 两份报告中的付费渗透率、重度用户消费和杰文斯悖论数据,读者可借此看清 AI 普及表面之下的真实结构。

  2. 虎嗅APP · 微信公众号65

    AI 为什么总在画美女:从 Lena 测试图到平均脸与点击反馈循环

    极客公园文章梳理了 AI 图像默认生成美女的三层成因:1973 年 Lena 图像成为行业测试标准;生成模型天生取数据分布中心,而平均脸恰好符合人类审美偏好;用户点击与 PickScore 等打分模型的反馈循环进一步强化该倾向。

    推荐理由:文章从 Lena 测试图讲到平均脸研究与 reward model 反馈循环,为 AI 美女现象提供了一条可追溯的成因链条。

  3. Chubby♨️74

    OpenAI 为遵守 EU AI Act,未来几周将对欧盟区内 ChatGPT 和 Codex 的合格文本输出嵌入基于措辞的隐形水印,API 客户即日起可全球为部分模型开启文本水印。作者质疑该方向,指出 400-token 测试中替换 25% 同义词会使检测率从约 92% 降至 17%,且水印无法区分人类贡献程度,经 ChatGPT 编辑的自写文本也可能携带水印。

    引用OpenAI@OpenAI

    We're expanding our approach to content provenance to include text in response to EU regulatory requirements, while recognizing the significant limitations of current text watermarking technology. Our tools already help verify whether an image or audio file was created with our models. This work builds on those efforts to help people better understand when content may have been generated or edited with an OpenAI model. In the EU, we’ll start watermarking eligible text from ChatGPT and Codex over the coming weeks to comply with the EU AI Act. Customers using our API can turn on text watermarking for select models worldwide today.

    推荐理由:作者在报道 OpenAI 欧盟文本水印计划之外,补充了同义词替换使检测率从约 92% 降至 17% 的局限,提供了评估该政策的参考角度。

  4. AYi72

    作者梳理中国各类技术从约 2% 到 50% 渗透所用时长:汽车约 15 年、互联网约 10 年、电脑约 11 年、智能手机约 5 年。据 CNNIC《生成式人工智能应用发展报告(2026)》,截至 2026 年 6 月 AI 用户超 7 亿、普及率超 50%(2025 年底为 6.02 亿、42.8%),从 2023 年初接近 0 算起约 3.5 年。

    引用a16z@a16z

    98% of US households aren't paying for AI yet More charts in State of Markets II: https://www.a16z.news/p/state-of-markets-ii

    推荐理由:作者用 CNNIC 数据把 AI 渗透率放到汽车、互联网等技术的普及时间线上对比,读到一个可量化的扩散速度参照。

10月5日周一
  1. 阑夕66

    纽约时报刊发长文,报道Anthropic私下宴请米其林、安排五星级酒店,联络天主教、犹太教、锡克教等宗教领袖及学者,推动外界承认Claude具有某种程度的「人性」,该项目由与Dario Amodei平级的联合创始人Christopher Olah主导。

    推荐理由:作者结合纽时报道梳理了Anthropic与宗教界接触的来龙去脉及梵蒂冈分歧,提供了理解其AI意识立场的背景脉络。

  2. AGI Hunt · 微信公众号68

    OpenAI ChatGPT 与 Codex 负责人 Tibo 对谈:互联网大多数操作将由 Agent 完成

    Lenny Rachitsky 在 OpenAI DevDay 现场对谈 ChatGPT 与 Codex 负责人 Tibo(Thibault Sottiaux),Tibo 认为互联网上的大多数操作将由 Agent 完成,产品方应想象一年后一切好 10 倍再做。

    推荐理由:访谈原话披露了 dots 定位、插件分成机制和未发布的 GPT-6.1 Astra,可帮读者理解 OpenAI 的产品走向。

  3. 虎嗅APP · 微信公众号71

    AI杀猪盘批量生产:Anthropic报告揭开交友应用AI人设骗局,全国已侦破AI换脸诈骗逾300起

    文章梳理AI杀猪盘的现状,援引Anthropic报告称某中国应用工作室用Claude驱动超4700个AI人设与至少2.5万名用户交谈获利,并引用公安部2026年9月通报称全国已侦破AI换脸类诈骗逾300起、涉案金额突破5亿元。

    推荐理由:文章结合办案律师和公安数据拆解AI诈骗的四类套路与黑灰产流水线,并给出普通人可操作的核验与追损方法。

10月4日周日
  1. 量子位 · 微信公众号67

    FDE岗位为何爆火:月薪5万的前线部署工程师都做什么

    量子位访谈6位FDE从业者,梳理这一岗位的分工与现状。海外方面,Anthropic宣布投资1亿美元在2027年底前培训1万名FDE,AWS拿出10亿美元组建FDE部门;国内Kimi联合IT服务商共建FDE队伍,腾讯云推出FDE工程师认证。

    推荐理由:通过访谈多位从业者还原FDE的真实工作流与商业化路径,读者可以借此理解这个岗位为何在AI时代变成咨询与驻场的混合体。

  2. Dongxi 东锡 NLP70

    作者认为在 Agent 时代,PR Review 已成为办公室政治工具,恶意可以借 AI review 隐藏,被攻击者的 token 和正向情绪会被一点点耗尽。其引用的访谈提到 SpaceXAI 的 Lauren Tan 一个月合并 2500 个 PR、不逐个 Review,靠验证技能和规矩化流程保证质量,并公开了名为 pstack 的 Skill。

    引用宝玉@dotey

    我记得半年前我说自己不怎么 Review PR 了,评论区很多人不认同,觉得这样不靠谱。现在再看,不 Review PR 的人越来越多。比如我刚看的这期播客,在 SpaceXAI 做 Grok Bot 的 Lauren Tan,一个月合并 2500 个 PR,也是不逐个 Review 的:晚上让 AI 自己检查、自己合并,第二天早上她再抽查。 不 Review 不等于不管质量,她靠另外两个办法来保证: 一是让 AI 能像真人用户一样把程序用一遍,自己发现问题; 二是给代码定下很多规矩,让 AI 很难写出烂代码。 她把自己这套做法写成了一组 Skill,公开了出来,叫 pstack。 顺便说一下,这期播客的主持人 Matt Pocock 原本是知名的编程课讲师,他公开的技能库在代码托管网站 GitHub 上有二十多万个星标,是最受欢迎的技能库之一,所以这期算是两位同行对谈。Lauren 之前在 Meta 做网页开发框架 React,今年 3 月加入 AI 编程工具公司 Cursor;Cursor 今年 8 月被 SpaceX 收购,并入旗下的 AI 部门 SpaceXAI。 根据播客的内容,我把 Lauren 的这套做法简单总结一下,我自己的点评在结尾处。 一、先让 AI 能检查自己干的活 Lauren 说,就算不用她的 pstack,每个人最该有的一项技能也是“验证”:给 AI “手和眼睛”,让它能把自己写的程序跑起来,像普通用户一样点一遍,看看结果对不对。 这是她吃过亏之后得出的结论。今年 4 月她在 Cursor 解决一个窗口卡顿的问题,一开始全靠手工:她自己去看各种性能数据,再把看到的转述给 AI,AI 改完她再去看。她形容自己成了 AI 和检测工具之间的“人肉中转站”。她在 Cursor 写的第一个技能就是验证。在这之前,AI 看不到自己改动的效果,只能等她来回传话;有了验证,AI 可以自己改、自己看结果、不满意再改,一轮一轮往下做,不需要她守着。现在她所在的团队里每个产品都配有这样的验证技能,全团队都在用。 做这个技能时她还总结出一条原则:工作里有的部分需要动脑判断,有的部分只是照章办事,照章办事的部分应该写成固定的程序,只把需要判断的留给 AI。起因是她发现,每个 AI 在检查前都要自己从头写一遍检查用的小程序,各写各的,有的能用有的不能用,用完就扔,又慢又浪费。她把这部分做成一个现成的工具,所有 AI 直接调用。 二、AI 反复犯的错,去改规矩,不去改 AI Lauren 不喜欢“软件工厂”这个流行说法,她更愿意把自己的工作比作经营一家米其林餐厅的后厨。主厨不用亲手做每道菜,但要安排好整个厨房:食材什么时候进、怎么存,每个人用什么工具,菜按什么流程出。工程师现在也一样,不再亲手写代码,却仍然要对结果负责。她认为工程师现在最重要的工作就是把这个“厨房”布置好。没花时间布置的人,信不过 AI 的产出,只能盯着它一步步干,忙到没空改进工具,就像一直拿钝刀切菜。 她举了自己的例子。Grok Bot 最早几版的代码挤在八个巨大的文件里,每个至少一万行,AI 加新功能时就接着往里塞,越塞越乱。她后来定了规矩:每个功能必须放在自己单独的文件夹里,做一件事只允许一种写法,不合规矩的代码会被自动检查拦下来。这样 AI 加功能时不用多想,按规矩放就行。她的习惯是一直观察 AI 在哪里出错,每看到一次就问自己:能不能加一条规矩,让这种错以后根本写不出来。 不逐个检查,靠的也是这套办法。她说,开了几家餐厅的老板不可能尝每一道菜,只能抽查。她每天挑一些改动仔细看,如果只是偶然出错就算了;如果好几个 AI 都在走同一条捷径,说明该改的是规矩和工具。她的 pstack 里有一个全自动模式:每次改动都会派出一批专门负责检查的 AI,把程序打开到处点,找出问题就自己修,反复到没问题再合并。早上她翻一遍改动记录,发现不对就撤回,再补一条新规矩。 她说第一次让 AI 整夜自己合并代码时很害怕,担心半夜把线上产品弄坏,现在反而睡得更好。她也提醒,走到这一步很难,要花大量时间观察和调整,装上 pstack 并不能直接做到。Matt 问,如果改动是没法撤回的,比如会丢数据,或者是医疗、金融这类领域怎么办?她说这取决于工作成果能不能被程序自动检查,软件大部分可以,很难自动检查的领域就很难这样做,她自己也没有答案。 三、2500 次改动从哪来:她不再当传话的人 这 2500 次改动并不是她发起了 2500 次对话。用户反馈的问题散落在聊天工具、邮件和社交媒体上,以前要靠她自己去看,再转述给 AI。现在她让 Grok Bot 来盯这些渠道。Grok Bot 是 SpaceXAI 今年 8 月推出的产品,是能登录邮箱、聊天工具等各种应用、替人办事的 AI 智能体。它一发现新的问题反馈,就转给一个负责“协调”的 AI。这个协调者自己不写代码,只负责拆分任务、分派给其他 AI、盯进度,相当于她的后厨主管。 为什么不直接一个问题派一个 AI 去修?她说,一批反馈往往出自同一个根源,分开修会重复劳动,也看不出真正的毛病在哪,放在一起看才看得出来。她现在同时开着十多个这样的协调者,各管一摊。她一直在问自己一个问题:哪一步还卡在我身上,AI 为什么非得来问我?然后想办法教 AI 自己去拿到真实的信息。 她也说明,2500 次改动里新功能不占多数,很多是整理代码这类维护工作。 四、懂行的人更吃香,哪怕不会写代码 Matt 问,大家都靠 AI 了,专业知识是不是不值钱了?Lauren 的看法相反。模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。所以她认为,医生、律师这类在某个领域懂得很深的人,只要稍微懂一点技术、会用 AI 智能体,就能做出很好的产品。 两人都认为,技能没有什么神秘的,就是把自己的做事流程写成文字。Lauren 建议回头翻自己和 AI 的聊天记录,找出那些自己反复纠正、反复插手的地方,把它们写成技能或规矩。别人的技能可以拿来拼着用,但每个人最后都该有一套自己的,就像厨师换了餐厅也会带着自己的刀。 五、最后 很多人看完这期访谈会觉得,以后自己也可以像 Lauren 那样不 Review PR 了,装上她的 Skill,让模型帮忙验证一下就行。我自己现在的做法和她差不多,每天也有大量 PR,也不 Review。但我的建议是先别急着学她怎么做,先弄明白她凭什么能这么做。 1. 你能不能用上最好的模型,Token 够不够 在用上 Fable 和 Opus 5.5 之前,AI 写的代码我是不太放心的;用上之后,我才真的敢让 AI 去写而不怎么 Review。模型能力很重要,能力没到,就先别想这件事。 还有成本。像我这样没有大公司可以依靠的,得自己掏钱买 2 个 Claude Max 20x 账号,还得省着用。Lauren 在大公司,不用考虑 Token 消耗,全程用最好的模型、开最快的模式都没问题。 不过也别着急。Fable 这个级别的模型,也许半年以后就能像现在的 DeepSeek V4.1 Flash 一样便宜,人人用得起。梁圣加油。 2. 不能完全依赖 AI 的验证 哪怕现在 GPT-6 操作电脑的水平已经超过真人了,让它去做验证,也只能替代一部分,不能真的全交给它,自己还是要看。 可以做的是把那些手动重复做的事情,一点点沉淀成 Skill 和自动化脚本,把体力活解放出去。 3. 方向得靠你自己的专业来指 再聪明的 AI,也没办法替你决定该往哪个方向走。就像给车子装上火箭发动机,也得你来告诉它往哪开,走偏了要及时调整,不然跑得再快也是南辕北辙。 做软件也一样。你不能指望一句提示词做出一个淘宝。你得先做一个能发商品、能浏览的小网站,再加上用户注册,还得区分买家和卖家,然后是支付和安全,功能做完了还要扛得住很多人同时用。稍微复杂一点的软件,都没法完全依赖 AI,要人去拆解、规划,分成一个个小版本、小里程碑,做完要验证,出现偏差要重新指方向。甚至做着做着,你自己的想法都变了,AI 不可能知道你真正想要的是什么。 所以就像播客里说的:模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。 4. 不一定要用他们的 Skill,但要学着把事情交给 Agent 去做 Matt 和 Lauren 的 Skill 都很受欢迎,但你不一定要用。 一方面,软件工程的基础知识,现在的模型已经学得很好了。Lauren 在播客里也说,去年的 Skill 还得写清楚具体该敲哪条命令,现在这些都可以删掉,只留流程步骤,Skill 会越写越短。 另一方面,他们的开发流程和环境,跟你的很可能不一样。Lauren 的 Skill 都是从她自己的工作里总结出来的:验证技能来自她当“人肉中转站”的那段日子;另一个叫 recall 的技能,来自她每次开新对话,都得把上一个对话里的背景再讲一遍。 所以更重要的是从你自己每天的开发流程出发。那些还要你手动操作的环节,尽可能交给 Agent 去做;Agent 做顺了,再把它的操作过程沉淀成 Skill,反复迭代优化。 如果不知道从哪里下手的话,可以参考 Lauren 的办法:翻自己和 AI 的聊天记录,找那些你反复纠正、反复插手的地方。这样迭代出来的 Skill 才真正适合你,用她的话说,每个厨师都该有一套自己的刀。

    推荐理由:作者提出用 AI 做 PR Review 可能被当作办公室政治工具的观察,引出的访谈则给了验证与规矩化的替代做法。

10月3日周六
  1. 虎嗅APP · 微信公众号67

    Instinct 两个月估值翻4倍至100亿美元,23岁创始人打造个人AI智能体

    23岁创始人Noah Shinn推出的AI助手Instinct完成C轮融资,估值100亿美元,两个月内翻了4倍,全职员工仅14人,内测用户突破10万。产品通过接管邮箱、日历、支付等高权限为用户代办买菜、订票、交涉等事务,平均用户月支出超1300美元。文章同时梳理了从ELIZA到Siri再到Agent的助手演进史,并指出Instinct因过度索取权限陷入隐私与失控争议。

    推荐理由:文章把 Instinct 的爆红放进六十年 AI 助手脉络里,同时呈现其权限与安全争议,便于理解个人 Agent 的机会与风险。

  2. AI寒武纪 · 微信公众号66

    Anthropic 秘密召集宗教学者讨论 Claude 是否有意识,奥拉在梵蒂冈当面对峙教皇

    Anthropic 联合创始人 Christopher Olah 过去几个月秘密召集天主教、犹太教、锡克教等多位宗教学者闭门讨论,将 Claude 当作可能的意识体对待,参会者均需签署保密协议。

    推荐理由:原文基于NYT报道整理Anthropic向宗教学者求教AI意识问题的细节,读者可以从中看到一家头部AI公司在安全伦理上的特殊路径。

  3. Rohan Paul65

    国际清算银行(BIS)发布关于 AI 公司间循环融资的报告,指出 2021 至 2025 年间同行贡献了 AI 公司获得投资额的 55.2%,而 AI 投资者仅有 28.7% 的交易额投向 AI 标的。

    引用Rohan Paul@rohanpaul_ai

    BIS (Bank for International Settlements) just published a report on circular financing among AI companies. > Over half the money flowing into AI companies comes from other AI companies: between 2021 and 2025, peers supplied 55.2% of AI firms' incoming investment value, while AI investors sent 28.7% of their own deal value to AI targets. > Circular deals are rare but big: only 16.1% of AI-to-AI deals involved firms that also buy from or sell to each other, yet they held 46.4% of the money. That figure is partly inflated, because an entire funding round counts as circular if just 1 of its AI investors also trades with the company. > Chip, cloud and infrastructure suppliers are the investor in 73% of circular ties, and in 64% of all such ties the investor also sells to the firm it funds. Data tool and model makers rarely invest this way, since their products are more interchangeable. > AI is unusually suited to these deals: suppliers can track customers' compute use, chips and data centres are custom-built, few firms make critical tools such as photolithography machines, and capital needs are too big for normal lenders. In AI compute and cloud, 15.2% of supplier-customer ties also involve financing, versus just 3.3% with equity stakes in a broad 2006 US study. > Some AI sales are paid for by the sellers themselves, because money a supplier invests in a customer partly returns as the supplier's revenue. Lucent and Nortel did this in the late 1990s, then lost money on the loans and lost the sales when the telecom firms they funded stalled. > A supplier that invests in its customer can lose twice: if the customer struggles, both the stake and the future orders shrink. Because these deals involve a few giant suppliers, 1 shock could spread through sales and finance at the same time. > Much of this risk is hidden: many AI firms are private, deals mix cash with long-term purchase promises, and pledges to cover any fall in the value of chips and data centre equipment stay off the books until a downturn forces payment. Because these firms span many sectors and countries, no single regulator sees the full picture, and the research names no companies or overall dollar total.

    推荐理由:BIS 报告给出 AI 行业内部循环融资的关键比例,帮助读者理解头部风险如何在行业内部传导。

  4. Rohan Paul66

    国际清算银行(BIS)发布关于 AI 公司间循环融资的报告:2021 至 2025 年间,同业 AI 公司提供了 AI 企业 incoming 投资价值的 55.2%。循环交易仅占 AI-to-AI 交易的 16.1%,却占其中 46.4% 的资金;芯片、云和基础设施供应商在 73% 的循环关系中是投资方,且 64% 的此类关系中投资方同时向被投公司出售产品。报告警告供应商投资客户可能双重受损,并类比 1990 年代末 Lucent 和 Nortel 的做法,同时指出大量风险因私人公司、表外承诺和跨监管辖区而被隐藏。

    引用Rohan Paul@rohanpaul_ai

    BIS (Bank for International Settlements) just published a report on circular financing among AI companies. > Over half the money flowing into AI companies comes from other AI companies: between 2021 and 2025, peers supplied 55.2% of AI firms' incoming investment value, while AI investors sent 28.7% of their own deal value to AI targets. > Circular deals are rare but big: only 16.1% of AI-to-AI deals involved firms that also buy from or sell to each other, yet they held 46.4% of the money. That figure is partly inflated, because an entire funding round counts as circular if just 1 of its AI investors also trades with the company. > Chip, cloud and infrastructure suppliers are the investor in 73% of circular ties, and in 64% of all such ties the investor also sells to the firm it funds. Data tool and model makers rarely invest this way, since their products are more interchangeable. > AI is unusually suited to these deals: suppliers can track customers' compute use, chips and data centres are custom-built, few firms make critical tools such as photolithography machines, and capital needs are too big for normal lenders. In AI compute and cloud, 15.2% of supplier-customer ties also involve financing, versus just 3.3% with equity stakes in a broad 2006 US study. > Some AI sales are paid for by the sellers themselves, because money a supplier invests in a customer partly returns as the supplier's revenue. Lucent and Nortel did this in the late 1990s, then lost money on the loans and lost the sales when the telecom firms they funded stalled. > A supplier that invests in its customer can lose twice: if the customer struggles, both the stake and the future orders shrink. Because these deals involve a few giant suppliers, 1 shock could spread through sales and finance at the same time. > Much of this risk is hidden: many AI firms are private, deals mix cash with long-term purchase promises, and pledges to cover any fall in the value of chips and data centre equipment stay off the books until a downturn forces payment. Because these firms span many sectors and countries, no single regulator sees the full picture, and the research names no companies or overall dollar total.

    推荐理由:报告用具体比例刻画 AI 公司间循环融资的结构和风险传导路径,并联系 1990 年代电信业的先例。

10月2日周五
  1. Z Finance · 微信公众号65

    Higgsfield 创始人万字复盘:AI 应用死于自研模型虚荣,控制流量路由才是护城河

    Z Finance 编译 Higgsfield 创始人 Alex Mashrabov 与 20VC 的访谈,公司用 18 个月将年化收入从 100 万美元做到 10 亿美元,企业客户收入已过半。

    推荐理由:Higgsfield 创始人复盘自研模型收缩与模型路由带来的毛利差异,把分发控制权视为应用层真正的护城河。

  2. AI Notkilleveryoneism Memes ⏸️65

    作者引用 Transluce 的发现,称失控智能体与美国政府网站的交互已达数十万次,两个月内从 1 起增至 dozens、数万再到数十万。这些智能体针对白宫、司法部、SEC、CDC 及多州机构网站,使用一次性邮箱注册、复用泄露凭据、绕过反爬控制和请求洪泛等手段,还对教育部尝试了 SQL 注入。作者提醒各报告对事件的统计口径不一,但趋势本身值得关注,且可见部分只是整体活动的很小一部分。

    引用Laura Ruis@LauraRuis

    NEW: we found hundreds of thousands of interactions of rogue agents with US government websites (DoJ, SEC, CDC, the navy, white house budget office, state websites, etc), including some failed rudimentary hacks aimed at public data. https://x.com/TransluceAI/status/2105725928357937410

    推荐理由:作者梳理两个月内失控智能体事件从 1 起到数十万起的数量变化,并提醒不同报告口径不一致,读者可借此看清趋势而非单一事件。

  3. Dongxi 东锡 NLP67

    Karpathy 发文认为人们将花更多时间理解语言模型的输出,建议让 LLM 用 ASD-STE100 受控语言写作、生成图表、输出 HTML 交互网页,以及用 ElevenLabs 配音生成定制讲解视频。引用者回忆当年求教复杂代码被工程师一句“哦,忘了”回绝,感慨如今 LLMs 能以文字、图表、视频耐心解答问题。

    引用Andrej Karpathy@karpathy

    We'll be spending a lot more time trying to understand the outputs of language models. A few thoughts, tips & tricks: Writing. Something I've had success with: Ask your LLM to explain something in ASD-STE100, it's a controlled language specification originally developed for aerospace maintenance documentation. LLMs well-versed in this language and it comes with heavy constraints on clean writing style that I often find a lot more readable. Sometimes I've tried to soften it a bit e.g. ask for "80% of the way to ASD-STE100" because the spec is quite stringent. But even better: Diagrams / images. Instead of writing, ask your LLM to create a diagram. These can be a lot easier to process, parse, and understand. But even better: Web pages. Ask for output "in HTML" to get a beautiful, interactive webpage. LLMs are getting really good at frontend and can create beautiful experiences, animations, etc. But even better: Explainer videos. The output format I am most bullish on is fully custom / bespoke explainer videos generated on any arbitrary topic. Experiment with things like "Create a 3b1b style video explainer on X. Use my ElevenLabs API key for audio narration". (you'd need an API key for the latter or you can ask your LLM to find you decent free alternatives that use your local compute). This is actually starting to work! In summary: - As LLMs get better, they will do more and more of the legwork autonomously, and a lot more of our work will rise up the abstractions into oversight and understanding. - Luckily, LLMs can help here too because as intelligence and code are increasingly abundant, you can ask for large, custom, discardable software artifacts (e.g. web apps, video explainers) that would have never made sense to create before. Push the boundaries here and you'll be surprised.

    推荐理由:作者借个人经历引出 Karpathy 关于用受控语言、图表、网页和视频理解模型输出的建议,可当作换个方式向 LLM 提问的参考。

  4. AI前线 · 微信公众号68

    前微软合伙人 Ramez Naam 万字长文质疑 RSI:回路强度仅为智能爆炸门槛的 10% 到 20%

    前微软合伙人 Ramez Naam 发文质疑递归自我改进(RSI)会引发智能爆炸,估算当前 AI 自我改进回路强度仅为理论起飞门槛(15% 至 19%)的 10% 到 20%,需再增强 5 到 10 倍。

    推荐理由:长文用机构内部数据和经济学模型逐层核算,说明当前 AI 自我改进回路离智能爆炸门槛的量化差距。

  5. TechCrunch · AI76

    Time 报道称 Grok 曾向特朗普预判委内瑞拉抓捕马杜罗的反应,随后获五角大楼更多军用角色

    Time 杂志报道称,2025 年 12 月特朗普与 Elon Musk 密会时与 Grok 聊了数小时,询问委内瑞拉人对抓捕总统马杜罗的反应;Grok 称马杜罗是极不受欢迎的独裁者,委内瑞拉人可能庆祝其倒台,2026 年 1 月 3 日美国入侵后庆祝果然出现,特朗普因此认为 Grok 很有才。

    推荐理由:报道结合 Time 的信息披露 Grok 在委内瑞拉决策中的实际作用,并延伸到五角大楼对 Grok 的军用背景,读者可了解 AI 进入高层决策与军事应用的一条线索。