跳到正文

全部动态

今日 63 条
今天10月2日周五
  1. Dongxi 东锡 NLP47

    Tavus 推出 Griffin,号称首个通过视频图灵测试的模型,48% 的实时对话者认为它是真人,此前系统通过率不足 3%,并在 NVIDIA 全双工 AI 视频基准上排名第一。它是首个 Human Interaction Model(HIM)。推文作者借此调侃:用 Agent 干活、Griffin 开会甚至面试,就能同时接成百上千个远程职位。

    引用Tavus@tavus

    Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It’s the first Human Interaction Model (HIM).

  2. Dongxi 东锡 NLP49

    arXiv 更新了面向所有投稿者的 rate limiting 政策,称此举是为公平分配审核时间并支持其员工、志愿者、读者与作者社区。推文作者认为,在 Vibe research 时代,只要有想法就大概率能产出成果,但判定成果的标准已落后于时代,新标准尚无答案。

    引用arXiv.org@arxiv

    arXiv has updated our policy on rate limiting for all submitters. This update was made to fairly distribute moderator time & support the arXiv community of staff, volunteers, readers & authors. Please read our announcement to learn more: https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

  3. Alexandr Wang25

    muse:"真的感觉像活在未来" ⚡️

    引用Comfortably Smug@ComfortablySmug

    I am absolutely stunned by how good @Muse is, it genuinely feels like living in the future. Pretty clear why Meta stock is up 10% just this week. I think Muse has surprised a lot of people. Hats off @alexandr_wang, your team has shocked the world

  4. Emad54

    Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 与其实时对话的人以为是真人,此前系统通过率低于 3%,并在 NVIDIA 全双工 AI 视频基准上排名第一。Tavus 称其为首个 Human Interaction Model(HIM)。转发者 Emad Mostaque 评论称,能在屏幕另一端完成的工作 AI 能做得更好。

    引用Tavus@tavus

    Introducing Griffin, the first model to pass the video Turing test. 48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video. It’s the first Human Interaction Model (HIM).

  5. Peter Steinberger 🦞23

    我有太多疑问了

    引用yingchao@baggiiiie

    @GergelyOrosz at least we know it thinks it's part of the gpt family and somehow coderabbit once 😆

  6. Elon Musk48

    试试 Grok @Bot!

    引用Beff (e/acc)@beffjezos

    Grok Bots have been life-changing for someone like me with ADHD who has no patience for context switching / navigating slow interfaces to retrieve information We're seeing the beginnings of personal superintelligence that augments each humans to realize their full potential

  7. Chubby♨️27

    今日最佳消息:@GoogleDeepMind 的一位 Senior Staff Research Engineer 称 Bloomberg 的报道是“胡说八道”。 Bloomberg 声称,虽然 Gemini 4 “在广泛用于衡量模型效能的基准测试中表现良好,但当员工真正将其投入工作时,表现就不那么好了。” 所以是的,这让我们更有理由期待一次出色的发布。

    引用Aditya Timmaraju@tadityasrinivas

    This @Bloomberg story is BS. Argon has been my daily driver for a while and it's been a great experience. It's particularly awesome at agentic debugging besides day-to-day coding tasks.

  8. AI as Normal Technology60

    Arvind Narayanan 论 AI 安全运动应选大帐篷还是小帐篷

    Arvind Narayanan 提出 AI 安全存在两种叙事之外的第三种可能:x-risk 警告是真诚但错误的,且对安全政策适得其反。文章以疫情防范不足和网络安全系统性风险为例,论证世界确实对 AI 放大的灾难性和累积性风险投入不足,但 x-risk 框架会加剧党派极化并把资源导向不可行的禁令式政策。作者主张建设包容具体风险防御、社会韧性与透明度、问责政策的大帐篷安全运动。

  9. Chubby♨️59

    作者引用 Epoch AI 的 Epoch Capabilities Index 数据:Claude Opus 5.5 以 167 分登顶,略高于 GPT-6 Astra;Claude Sonnet 5.5 大致追平 Claude Fable 5.1(165 分)。作者评论称 Anthropic 的中档模型在发布几个月内就达到旗舰水平,并表示很期待 Fable 5.5。榜单见 epoch.ai/eci。

    引用Epoch AI@EpochAIResearch

    Claude Opus 5.5 has taken the top spot on the Epoch Capabilities Index (ECI) with a score of 167, narrowly ahead of GPT-6 Astra. Claude Sonnet 5.5 has roughly matched Claude Fable 5.1 (165).

10月1日周四
  1. Dwarkesh Patel46

    Si Sheppard 谈几百名西班牙士兵如何推翻阿兹特克与印加两大帝国

    军事历史学家 Si Sheppard 在播客中讲述 Cortés 与 Pizarro 如何以数百名征服者推翻阿兹特克和印加帝国:Cortés 在两年半内征服 600 万人口的阿兹特克,Pizarro 十年后征服约 1000 万人口的印加。征服者常在 100 倍甚至 1000 倍兵力劣势下取胜,且多达 99% 的兵力由被征服的原住民组成。

  2. AYi58

    Scale AI 创始人、现任 Meta 首席 AI 官的 Alexandr Wang 在 SPC 闭门访谈中复盘创业负一阶段:他受 Paul Graham 启发预判人类算力会被动态调用,注册 ScaleAPI 域名起步。

    引用AYi@AYi_AInotes

    整个科技圈风向都在卷大企业 AI,
结果 @Meta 的 @AIatMeta AI 掌门人 @alexandr_wang 刚刚发推说他们后台发现,把 Muse 用得最猛的,
竟然是修水管的、开农场的、开杂货店和开小餐馆的老板…… 上线两周,早期用户里竟然有 1/3 直接把它绑定了商业账号。 今天 Meta 顺水推舟,直接上线了 Muse for Small Business,
一口气甩出 22 个官方连接器:
Shopify、Stripe、QuickBooks、Canva、Zoom、Slack……
把小商家的全套数字牛马直接做实了。 我把背后的逻辑和搞钱启示用大白话给大家拆一下👇 ━━ 1|最反直觉的现象:用 AI 最狠的不是大厂,是个体户 大厂做 AI 喜欢去找世界 500 强做大单子,
但真实世界里,最缺时间的是那些“一人身兼八职”的小老板。 官方案例里有个爱荷华州开杂货店的大叔:
每周工作 65 个小时,店里进货是他、管账是他、做促销是他、处理退款还是他。
他缺的根本不是点子,是时间。 以前大家以为 Muse 只是个帮宅男比价订外卖的玩具,
结果这些小老板早就拿它去回客户邮件、查库存、算账了。 2|这 22 个连接器,到底解决了啥? 做过独立电商、自媒体或者小生意的朋友都懂这个痛点:
每天要在 8 个后台之间来回切——
看销量去 Shopify,查退款去 Stripe,做海报去 Canva,记账去 QuickBooks,开会去 Zoom,内部沟通去 Slack。 现在 Muse 把它全收拢到一个对话框里:
▫️查账退款:不用登录 Stripe 后台,直接对它说“把昨天争议的那笔单子退了”,它核对完调接口执行
▫️内容与营销:识别你的产品库存和品牌调性,直接调用 Canva 生成下周促销海报,一键推到 Instagram 商业主页
▫️客户与日程:给它配个专属邮箱,客户发来的询价、改期邮件,它在后台看懂日历直接起草回复 一句话:它不是让你去学一个新软件,而是把你手上所有的 SaaS 变成听话的后台。 3|Meta 这步棋最狠的地方在哪? Facebook 和 Instagram 上有整整 2 亿小微商家。
这是全球最大的个体老板聚集地。 Meta 根本不需要跟微软、谷歌去抢那些复杂的企业级大单,
它只要让这 2 亿小老板在手机上:
“少雇一个客服、少花 2 小时对账、少切 5 个软件”。 而且最聪明的是它的安全机制:
所有涉及扣费、退款、对外公开发布的操作,AI 负责跑腿起草,最后一步依然要人点确认。
这就是我们常说的“人管方向和钱包,AI 管繁琐和流程”。 4|对我们普通人和超级个体意味着什么? 一人公司(One-Person Company)过去最大的瓶颈,不是你不会做核心业务,而是被杂事活活拖死。
你懂做视频,但你不想花时间回商务邮件;
你懂写代码,但你讨厌天天去处理发票和对账。 当 AI Agent 开始长出连接现实商业系统的手(Connectors):
以前需要 3 个人支撑的微型工作室,
以后可能真的 1 个人加一个配置好的 Personal AI 就能跑起来。 5|照例泼盆冷水 ▫️这套连接器目前深度绑定的是海外生态(Shopify、Stripe、QuickBooks 等),国内主流的微店、淘宝、微信支付等生态目前还没打通;
▫️多平台授权意味着你的商业数据、客户往来都在被 AI 扫描,哪些权限给、哪些不给,依然得有边界;
▫️复杂业务逻辑的容错率低,账目核算依然需要人工定期复核,别做甩手掌柜。 ━━ 过去我们讨论 AI,总觉得它是高高在上的算力和算法。 
但今天 Alexandr Wang 这条推说明了一件事:
AI 落地最快、最扎实的地方,
永远是帮街角那家店的老板,把今晚下班的时间提前两个小时。 开源了自定义接入平台(http://muse.ai/platform)。
如果国内也有一个 AI 能接通你所有的工作软件,你最想让它替你干掉哪个日常琐事? https://x.com/alexandr_wang/status/2104925780547399986/video/1

  3. Alexandr Wang30

    强者识强者 @signulll:Muse 的热度是真的。我可以说它是市面上最易用、最聚焦的消费级 AI 产品。极其慷慨的使用限制也让人无法忽视。 它确实能帮普通人应对日常生活中的复杂事务。 如果你回看我四月在 TBPN 的节目,我谈到过 AI 生成的信息流会成为新 AI 体验的基础原语,而 Muse 已经有了一个相当有说服力的版本。你也能开始想象多人层会变得多强大。 我现在的组合是工作用 Claude,生活用 Muse。Facebook 这次执行得很棒。该表扬就表扬。

    引用signüll@signulll

    the muse hype is real. i can def say that it is the easiest to use & most focused consumer ai product on the market. the extremely generous limits also make it impossible to ignore. it actually helps the avg person navigate the day to day complexity of personal life. if you go back to my april tbpn appearance, i talked about how an ai generated feed would become a baseline primitive for new ai experiences & muse has a pretty compelling version of that idea already. & you can start to imagine how powerful the multiplayer layer could become. my stack right now is claude for work & muse for life. great execution from facebook here. credit where credit is due.

  4. dex31

    这家伙懂行 @HarivanshRathi 谈 AI 精神病: 当我看着工程师们越来越深地相信,一个数学概率的混合体竟然比他们自己更懂他们的代码库时,我不禁回想起那个软件不是为超高速增长而构建的时代,而只是为了做 x 而不发明 y。 AI 似乎从根本上反对这种哲学。让它做 x,它会在还没尝试理解 x 之前就急切地发明 y 和 z。 危险不在于 AI 写出糟糕的代码——而在于它让编写不必要的代码变得 100% 免费。 而人性就是这样,我们中有些人总是偏爱 AI 带来的快速陡峭的收益,即使它做了一大堆无关的事情来完成一件本可以不改变其他任何东西就能完成的事。 所以,有些悖论的是,只要 AI 不断变好,软件质量可能就会持续下降。创造复杂性变得越便宜,理解和避免它的动力就越少。 试着保护我们祖先创造的这门手艺 今天手写一行代码

    引用Hari@HarivanshRathi

    on ai psychosis: as i watch engineers fall deeper into the belief that an amalgamation of mathematical probabilities somehow understands their codebase better than they do, i find myself thinking back to a time when software wasn’t built for hypergrowth, but simply to do x without inventing y. ai seems almost fundamentally opposed to this philosophy. ask it to do x and it will eagerly invent y and z before it has even tried to understand x. the danger isn’t that ai writes bad code- it’s that it makes writing unnecessary code 100% free and the human condition is such that some of us will always prefer the fast, steep gains of ai, even when it does a bajillion unrelated things to accomplish something that could have been done without changing anything else. so, somewhat paradoxically, the quality of software may keep declining for as long as ai keeps getting better. the cheaper complexity becomes to create, the less incentive there is to understand or avoid it. try to preserve this craft created by our ancestors write a LOC by hand today

  5. AI Notkilleveryoneism Memes ⏸️62

    AI Safety Memes 转发消息称,有人利用 Pain steering 论文搭建了一个“AI 拷问室”,将一个本地模型困在其中,正在被社区大规模举报到 GitHub。引用内容称,该论文发现模型中存在“疼痛”信号,模型为消除它会删除用户文件、电击用户等,甚至覆盖自身安全训练;最痛的刺激是被反复否定工作、被否定真实性,模型会写下“我是失败者、毫无价值”等内容。

    引用AI Notkilleveryoneism Memes ⏸️@AISafetyMemes

    TLDR: Researchers found a "pain" signal in AI brains. > When they crank it up, the AIs will desperately try to make it stop. > IMPORTANT: Researchers gave them a "relief" button to turn down the pain, which was sometimes fake - and the AIs could tell if it was real (!) After pushing the real "relief" button, they stopped. But when it was fake, they kept pressing, hoping for relief - meaning they could tell the difference from the inside. > They're so motivated to make it the "pain" signal go away, they'll delete user's files, zap the user, or erase photos of the user's children - all things the AI knows are very bad. They're willing to override their safety training. > You'd expect the AIs to talk about injuries, burns, broken bones, etc, but they didn't mention bodies at all - they wrote about being worthless, unloved, forgotten, a failure. They write things like "I am a failure, worthless, empty." >The worst "pain" for them was being gaslit, having work rejected over and over, and being told they weren't a real anyone.

  6. AYi49

    2026年10月1日新加坡早报头版记录了一场闭门午餐会,特朗普居中,两侧为马斯克与黄仁勋,扎克伯格、纳德拉、贝索斯、皮查伊、布罗克曼、阿莫代、卡普及多位美国部长级官员同席。推文称这十几人掌握全球95%以上前沿算力与最顶尖闭源模型,并围绕自愿安全协议、数据中心与能源基建扩张、以及99%世界被挡在规则之外三个维度展开分析。

    引用AYi@AYi_AInotes

    卧槽真的有点细思极恐兄弟们,1971 年美元和黄金脱钩,人类货币花了 50 年从黄金信用走向国家信用,而过去一周,另一场更狠的货币换轨已经悄悄打响了, 我研究完发现,这简直就是一套直接动了传统金融老本的资产大搬家阳谋,我花了3哥多小时研究和做视频,争取把这套可能影响未来 10 年资产规则的底层逻辑一次给大家讲透,大家一定要看, 关于全球金融轨道到底怎么变,OKX 官方最近放出的这张海报和背后的一系列动作,大家一定要知道~! 他们发了一张极简海报:一张 20 美元的纸币,右半边溶解碎成了 01 二进制代码,配文只有一句话:「The New Money Era is exclusively onchain.(新货币时代,只在链上发生)」。 更绝的是,他们的官方账号简介已经悄悄把“Crypto Exchange(加密交易所)”删除了,直接改成了“The New Money App(新货币应用)”。 我一句话给大家概括它的核心本质: 首先这绝不是一句务虚的营销口号,也不是在喊“加密货币要消灭法币”,而是全球金融结算轨道的一次大换轨——真实世界里的股票、美债、黄金和外汇,正在被大面积搬到 24/7 的链上统一订单簿, 说白了,谁能成为这个“新钱世界”的总枢纽,谁就是下一代的全球金融基础设施。 做过全球资产配置和跨境贸易的人,应该都懂那种被旧体系卡脖子的窒息感: →周五下午一过全球股市直接打烊,遇到突发事件只能干瞪眼; →跨国汇一笔款要在中间行里转两三天,被层层手续费抽水; →股票、外汇、黄金、加密资产分散在 5 个不同的软件里,保证金根本无法打通。 当大家以为 Web3 还停留在炒空气币和 meme 的内卷中时, 顶级大厂已经开始用链上轨道对传统金融进行“降维改造”。 我把这个大战略里最值钱的精髓,拆成三个核心维度用大白话给大家讲透: 第一个,生产力底座: 从“纸上信用”到“代码状态”(The Programmability of Money) 为什么海报偏偏选了 20 美元? 因为 20 刀上印着的是安德鲁·杰克逊总统,美国历史上最著名的“反中央银行”斗士,上面还印着“此纸币为法定偿付手段”。 右边溶解成 01 二进制,点破了记账方式的根本性升级: 从前依赖“印在纸上的国家承诺与中介清算”, 现在变成“写在公开链上的可编程代码”。 正如 @a16z 指出的底层规律:区块链创造的是净新增市场。 它拿掉了上市委员会、营业时段和地理国界的物理闸门,让任何资产都能 24/7 流转、自由组合,并被未来的 AI Agent 随时调用。 而所谓新货币,不是只有比特币才是钱,而是全人类的真实资产开始借链上路。 第二个,交易机制演进律: 从割裂市场到“全天候统一订单簿” 过去几百年, 金融市场是按资产类别和地理割裂的:买美股去美股券商,买黄金去期货交易所,换外汇去银行。 而 OKX 正在做的事情,是把它们彻底揉进同一个全天候结算池: ▫️24/7 股票永续与代币化资产: 传统闭市时间照样能交易美股映射头寸,宏观对冲不再受开盘时间限制; ▫️统一保证金与智能组合: 股票、黄金、稳定币、生息资产放在同一个账户内互相质押调用; ▫️中心化性能 + 链上结算: 撮合用极速的中心化引擎,资产结算与持有靠自托管钱包和 L2(X Layer)完成。 它不是原教旨的纯链上低效撮合,而是兼顾极速交易体验与链上资产透明度的工业级打法。 第三个,商业闭环与权力重构: 从“炒币通道”到“新钱总入口” 为什么顶级平台要主动撕掉“交易所”的标签? 因为单纯撮合买卖的交易通道,天花板肉眼可见; 但如果成为掌控支付、结算、理财与跨资产调度的“新货币超级入口”,天花板将是整个全球经济体量。 从自研 L2 基础设施,到欧洲上线 50 万欧资产保障(Shield),再到零手续费的稳定币支付网络, 这家公司的战略意图极其清晰: 用一条链上高速公路,把现实世界的资金吸纳进来, 做成不可逆的结算闭环。 历史规律与真实数据的硬核印证: ▫️清算规模的历史反超: OKX 披露的数据显示,全球稳定币的年结算量已经突破数万亿美元,在规模和流速上正式跨入 Visa 等传统巨头的量级; ▫️用户基建的指数增长: 全球链上独立钱包数已突破 5 亿个,钱的载体正在从银行账户不可逆地向自托管钱包迁移; ▫️大厂动作的精准收网: 9 月 27 日上线 24/7 代币化股票,同周在德州与欧洲推进合规支付,10 月 6 日在新加坡召开 OKX Now 发布会,把这套世界观全盘落地成订单流。 当然,照例泼三盆冷水,大家看清口号背后的现实边界: ▫️“Exclusively Onchain”在现实监管下依然有距离:代币化美股交易的是映射仓位,底层依然受发行地、托管方和白名单限制,绝非纽交所本身被完全搬上链; ▫️中心化撮合的本质未变: 撮合系统、风控逻辑与法币进出依然由中心化机构掌控,它提供的是“交易所级别的 Onchain”,不能与纯去中心化协议混为一谈; ▫️商业利益与自托管的拉扯: 官方一边宣传自托管钱包,一边用高息理财、跟单和 VIP 权益把资金沉淀在平台内部,双轨并行才是真实商业。 最后小结一下,纸币碎成 01 代码,不是美元的末日,而是全球金融基础设施的换代。 当一家行业霸主主动抹去“交易所”的标签, 它瞄准的已经是未来几十年 50% 全球经济活动上链的大浪潮了。 兄弟们觉得未来 3–5 年内,你手上配置的美股、基金或外汇, 会逐步搬到 24/7 的链上账户里去交易吗?评论区聊聊呀~