跳到正文

xAI / Grok

马斯克 xAI 与 Grok 系列的全部动态:模型迭代、算力扩张与 X 平台整合的持续追踪。

当前仅显示精选新闻

最新精选

第 1–20 条 · 共 97 条
今天10月6日周二
  1. 虎嗅APP · 微信公众号65

    AI 为什么总在画美女:从 Lena 测试图到平均脸与点击反馈循环

    极客公园文章梳理了 AI 图像默认生成美女的三层成因:1973 年 Lena 图像成为行业测试标准;生成模型天生取数据分布中心,而平均脸恰好符合人类审美偏好;用户点击与 PickScore 等打分模型的反馈循环进一步强化该倾向。

    推荐理由:文章从 Lena 测试图讲到平均脸研究与 reward model 反馈循环,为 AI 美女现象提供了一条可追溯的成因链条。

10月5日周一
  1. AYi66

    作者转述铁柱跑通的方案:用苹果快捷指令通过 Webhook 把微信合并转发的图文记录自动喂给后端 Grok Bot,云端自动解压、读取多模态内容并分类沉淀进知识库,回传收录回执。快捷指令还支持截图、录音、输入想法等五种收录模式,可绑定动作按钮或轻敲背面触发;快捷指令和 Bot 配置提示词已全部公开,导入即可使用。

    引用铁柱AGI@cgnot996

    https://x.com/i/article/2106981384502059008

    推荐理由:原文拆解了用 iOS 快捷指令加 Webhook 把微信图文记录自动沉淀进 Grok Bot 知识库的完整流程,配置已公开可直接导入。

  2. AYi65

    作者转述 @distortgeekin 的万字 Grok Bot 实战指南,核心观点是使用智能体不是写提示词,而是雇佣一个数字员工。指南提出六步法则,包括招岗位而非派临时活、首单挑可撤回的脏活、权限按可撤回性分级、试用期跑满三轮、自主权按五级阶梯授予、每周复盘并删掉无效自动化,并建议在系统提示词里加上拿不准就停下来问。作者还分享了自己自动发信 Bot 曾把草稿全部群发的翻车经历。

    引用distort@distortgeekin

    Grok Bot could be the first thing you hire instead of prompt It can own a job, work inside your tools for hours and come back with finished work In this article, I show you how https://x.com/i/article/2105262478535847936

    推荐理由:作者提炼了他人万字指南的六步驭工法则,把权限分级和试用期三轮验证等可复用方法讲得具体。

10月4日周日
  1. Dongxi 东锡 NLP70

    作者认为在 Agent 时代,PR Review 已成为办公室政治工具,恶意可以借 AI review 隐藏,被攻击者的 token 和正向情绪会被一点点耗尽。其引用的访谈提到 SpaceXAI 的 Lauren Tan 一个月合并 2500 个 PR、不逐个 Review,靠验证技能和规矩化流程保证质量,并公开了名为 pstack 的 Skill。

    引用宝玉@dotey

    我记得半年前我说自己不怎么 Review PR 了,评论区很多人不认同,觉得这样不靠谱。现在再看,不 Review PR 的人越来越多。比如我刚看的这期播客,在 SpaceXAI 做 Grok Bot 的 Lauren Tan,一个月合并 2500 个 PR,也是不逐个 Review 的:晚上让 AI 自己检查、自己合并,第二天早上她再抽查。 不 Review 不等于不管质量,她靠另外两个办法来保证: 一是让 AI 能像真人用户一样把程序用一遍,自己发现问题; 二是给代码定下很多规矩,让 AI 很难写出烂代码。 她把自己这套做法写成了一组 Skill,公开了出来,叫 pstack。 顺便说一下,这期播客的主持人 Matt Pocock 原本是知名的编程课讲师,他公开的技能库在代码托管网站 GitHub 上有二十多万个星标,是最受欢迎的技能库之一,所以这期算是两位同行对谈。Lauren 之前在 Meta 做网页开发框架 React,今年 3 月加入 AI 编程工具公司 Cursor;Cursor 今年 8 月被 SpaceX 收购,并入旗下的 AI 部门 SpaceXAI。 根据播客的内容,我把 Lauren 的这套做法简单总结一下,我自己的点评在结尾处。 一、先让 AI 能检查自己干的活 Lauren 说,就算不用她的 pstack,每个人最该有的一项技能也是“验证”:给 AI “手和眼睛”,让它能把自己写的程序跑起来,像普通用户一样点一遍,看看结果对不对。 这是她吃过亏之后得出的结论。今年 4 月她在 Cursor 解决一个窗口卡顿的问题,一开始全靠手工:她自己去看各种性能数据,再把看到的转述给 AI,AI 改完她再去看。她形容自己成了 AI 和检测工具之间的“人肉中转站”。她在 Cursor 写的第一个技能就是验证。在这之前,AI 看不到自己改动的效果,只能等她来回传话;有了验证,AI 可以自己改、自己看结果、不满意再改,一轮一轮往下做,不需要她守着。现在她所在的团队里每个产品都配有这样的验证技能,全团队都在用。 做这个技能时她还总结出一条原则:工作里有的部分需要动脑判断,有的部分只是照章办事,照章办事的部分应该写成固定的程序,只把需要判断的留给 AI。起因是她发现,每个 AI 在检查前都要自己从头写一遍检查用的小程序,各写各的,有的能用有的不能用,用完就扔,又慢又浪费。她把这部分做成一个现成的工具,所有 AI 直接调用。 二、AI 反复犯的错,去改规矩,不去改 AI Lauren 不喜欢“软件工厂”这个流行说法,她更愿意把自己的工作比作经营一家米其林餐厅的后厨。主厨不用亲手做每道菜,但要安排好整个厨房:食材什么时候进、怎么存,每个人用什么工具,菜按什么流程出。工程师现在也一样,不再亲手写代码,却仍然要对结果负责。她认为工程师现在最重要的工作就是把这个“厨房”布置好。没花时间布置的人,信不过 AI 的产出,只能盯着它一步步干,忙到没空改进工具,就像一直拿钝刀切菜。 她举了自己的例子。Grok Bot 最早几版的代码挤在八个巨大的文件里,每个至少一万行,AI 加新功能时就接着往里塞,越塞越乱。她后来定了规矩:每个功能必须放在自己单独的文件夹里,做一件事只允许一种写法,不合规矩的代码会被自动检查拦下来。这样 AI 加功能时不用多想,按规矩放就行。她的习惯是一直观察 AI 在哪里出错,每看到一次就问自己:能不能加一条规矩,让这种错以后根本写不出来。 不逐个检查,靠的也是这套办法。她说,开了几家餐厅的老板不可能尝每一道菜,只能抽查。她每天挑一些改动仔细看,如果只是偶然出错就算了;如果好几个 AI 都在走同一条捷径,说明该改的是规矩和工具。她的 pstack 里有一个全自动模式:每次改动都会派出一批专门负责检查的 AI,把程序打开到处点,找出问题就自己修,反复到没问题再合并。早上她翻一遍改动记录,发现不对就撤回,再补一条新规矩。 她说第一次让 AI 整夜自己合并代码时很害怕,担心半夜把线上产品弄坏,现在反而睡得更好。她也提醒,走到这一步很难,要花大量时间观察和调整,装上 pstack 并不能直接做到。Matt 问,如果改动是没法撤回的,比如会丢数据,或者是医疗、金融这类领域怎么办?她说这取决于工作成果能不能被程序自动检查,软件大部分可以,很难自动检查的领域就很难这样做,她自己也没有答案。 三、2500 次改动从哪来:她不再当传话的人 这 2500 次改动并不是她发起了 2500 次对话。用户反馈的问题散落在聊天工具、邮件和社交媒体上,以前要靠她自己去看,再转述给 AI。现在她让 Grok Bot 来盯这些渠道。Grok Bot 是 SpaceXAI 今年 8 月推出的产品,是能登录邮箱、聊天工具等各种应用、替人办事的 AI 智能体。它一发现新的问题反馈,就转给一个负责“协调”的 AI。这个协调者自己不写代码,只负责拆分任务、分派给其他 AI、盯进度,相当于她的后厨主管。 为什么不直接一个问题派一个 AI 去修?她说,一批反馈往往出自同一个根源,分开修会重复劳动,也看不出真正的毛病在哪,放在一起看才看得出来。她现在同时开着十多个这样的协调者,各管一摊。她一直在问自己一个问题:哪一步还卡在我身上,AI 为什么非得来问我?然后想办法教 AI 自己去拿到真实的信息。 她也说明,2500 次改动里新功能不占多数,很多是整理代码这类维护工作。 四、懂行的人更吃香,哪怕不会写代码 Matt 问,大家都靠 AI 了,专业知识是不是不值钱了?Lauren 的看法相反。模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。所以她认为,医生、律师这类在某个领域懂得很深的人,只要稍微懂一点技术、会用 AI 智能体,就能做出很好的产品。 两人都认为,技能没有什么神秘的,就是把自己的做事流程写成文字。Lauren 建议回头翻自己和 AI 的聊天记录,找出那些自己反复纠正、反复插手的地方,把它们写成技能或规矩。别人的技能可以拿来拼着用,但每个人最后都该有一套自己的,就像厨师换了餐厅也会带着自己的刀。 五、最后 很多人看完这期访谈会觉得,以后自己也可以像 Lauren 那样不 Review PR 了,装上她的 Skill,让模型帮忙验证一下就行。我自己现在的做法和她差不多,每天也有大量 PR,也不 Review。但我的建议是先别急着学她怎么做,先弄明白她凭什么能这么做。 1. 你能不能用上最好的模型,Token 够不够 在用上 Fable 和 Opus 5.5 之前,AI 写的代码我是不太放心的;用上之后,我才真的敢让 AI 去写而不怎么 Review。模型能力很重要,能力没到,就先别想这件事。 还有成本。像我这样没有大公司可以依靠的,得自己掏钱买 2 个 Claude Max 20x 账号,还得省着用。Lauren 在大公司,不用考虑 Token 消耗,全程用最好的模型、开最快的模式都没问题。 不过也别着急。Fable 这个级别的模型,也许半年以后就能像现在的 DeepSeek V4.1 Flash 一样便宜,人人用得起。梁圣加油。 2. 不能完全依赖 AI 的验证 哪怕现在 GPT-6 操作电脑的水平已经超过真人了,让它去做验证,也只能替代一部分,不能真的全交给它,自己还是要看。 可以做的是把那些手动重复做的事情,一点点沉淀成 Skill 和自动化脚本,把体力活解放出去。 3. 方向得靠你自己的专业来指 再聪明的 AI,也没办法替你决定该往哪个方向走。就像给车子装上火箭发动机,也得你来告诉它往哪开,走偏了要及时调整,不然跑得再快也是南辕北辙。 做软件也一样。你不能指望一句提示词做出一个淘宝。你得先做一个能发商品、能浏览的小网站,再加上用户注册,还得区分买家和卖家,然后是支付和安全,功能做完了还要扛得住很多人同时用。稍微复杂一点的软件,都没法完全依赖 AI,要人去拆解、规划,分成一个个小版本、小里程碑,做完要验证,出现偏差要重新指方向。甚至做着做着,你自己的想法都变了,AI 不可能知道你真正想要的是什么。 所以就像播客里说的:模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。 4. 不一定要用他们的 Skill,但要学着把事情交给 Agent 去做 Matt 和 Lauren 的 Skill 都很受欢迎,但你不一定要用。 一方面,软件工程的基础知识,现在的模型已经学得很好了。Lauren 在播客里也说,去年的 Skill 还得写清楚具体该敲哪条命令,现在这些都可以删掉,只留流程步骤,Skill 会越写越短。 另一方面,他们的开发流程和环境,跟你的很可能不一样。Lauren 的 Skill 都是从她自己的工作里总结出来的:验证技能来自她当“人肉中转站”的那段日子;另一个叫 recall 的技能,来自她每次开新对话,都得把上一个对话里的背景再讲一遍。 所以更重要的是从你自己每天的开发流程出发。那些还要你手动操作的环节,尽可能交给 Agent 去做;Agent 做顺了,再把它的操作过程沉淀成 Skill,反复迭代优化。 如果不知道从哪里下手的话,可以参考 Lauren 的办法:翻自己和 AI 的聊天记录,找那些你反复纠正、反复插手的地方。这样迭代出来的 Skill 才真正适合你,用她的话说,每个厨师都该有一套自己的刀。

    推荐理由:作者提出用 AI 做 PR Review 可能被当作办公室政治工具的观察,引出的访谈则给了验证与规矩化的替代做法。

10月2日周五
  1. TechCrunch · AI76

    Time 报道称 Grok 曾向特朗普预判委内瑞拉抓捕马杜罗的反应,随后获五角大楼更多军用角色

    Time 杂志报道称,2025 年 12 月特朗普与 Elon Musk 密会时与 Grok 聊了数小时,询问委内瑞拉人对抓捕总统马杜罗的反应;Grok 称马杜罗是极不受欢迎的独裁者,委内瑞拉人可能庆祝其倒台,2026 年 1 月 3 日美国入侵后庆祝果然出现,特朗普因此认为 Grok 很有才。

    推荐理由:报道结合 Time 的信息披露 Grok 在委内瑞拉决策中的实际作用,并延伸到五角大楼对 Grok 的军用背景,读者可了解 AI 进入高层决策与军事应用的一条线索。

10月1日周四
  1. AYi70

    美军战争部长 Pete Hegseth 在匡提科宣布马斯克、Anduril 创始人 Palmer Luckey 和前众议长 Newt Gingrich 共同领导子午线计划,要求 120 天内即 2027 年 1 月底前交出一份公开报告和机密附件,研究范围覆盖地下设施到地月空间,锁定 AI、自主系统、定向能武器、机器人、生物技术五大方向。

    引用AYi@AYi_AInotes

    Damn,马斯克又掌权了,但这次不是管政府效率,而是直接定义未来战争,老马前脚刚从 DOGE 抽身,后脚就被五角大楼直接推到了未来战争的决策台,我估计是俄乌战场上的廉价无人机,彻底把造航母坦克的传统军工打醒了。 视频里马斯克和科技新贵 Luckey 起立接受美军全场鼓掌,背后是五角大楼的一声叹息,将军们已经跟不上现代科技咯。 在刚刚结束的“部队国情咨文”现场,美国战争部长 Pete Hegseth 正式宣布:马斯克将联手 Anduril 创始人 Palmer Luckey、前众议长 Newt Gingrich,共同领导“子午线计划”(Project Meridian)。 现场 17 秒视频里,马斯克和花衬衫的 Luckey 起立接受全场鼓掌,估计 99% 的人以为这又是一场名流作秀,但咱们把背后的动作全拼起来,你会发现这是五角大楼近五十年最激进的一次“军事认知大换脑”。 今天把视频里没明说的硬核信息一次拆透👇 先说结论: 五角大楼公开承认了一个事实: 靠传统的将军会议和军工采购,已经跟不上现在的战争形态了。 他们直接把“未来战争长什么样”的定义权,打包外包给了硅谷极客。 这不是发一份新合同,也不是成立一支新部队,而是一场 120 天的闪电行动: 要求三个人在 2027 年 1 月底前,交出一份公开报告和一份机密附件,直接给美军画出未来几十年的军备采购地图。 为什么五角大楼突然急成这样?看看传统体系有多慢就知道了: ▫️俄乌战场已经把廉价无人机、算法自组网、消耗战打成了新常态 ▫️洛克希德、雷神等传统军工巨头,换个零件报价几万美元,一份规划报告能写三年 ▫️等你造好一艘航母,战场上的软件和无人蜂群已经迭代了十代 三个最值钱的维度展开聊聊👇 ① 人选组合极其狠辣:工程量产 + 杀手系统 + 政治翻译器 三个人不是随便挑的,分工精准到骨子里: ▫️马斯克(SpaceX / Tesla):负责“能不能造出来、能不能上太空、能不能低成本天量量产”(星链、运载、AI、人形机器人) ▫️Palmer Luckey(Anduril 创始人):负责“能不能立刻做成可部署的致命杀伤系统”(自主无人机、巡飞弹、战场传感器) ▫️Newt Gingrich(政坛老炮):负责把科技极客的狂想,翻译成国会能看懂、预算能通过的“国家使命”政治语言 喵的这根本不是学术研讨会啊,简直就是一个“战争产品化委员会”。 ② 战场维度的降维扩张:“从地下深处,到月球轨道” 官方明确把研究范围定为:从地下设施一直延伸到地月空间(Cislunar)。 重点锁死五大方向:AI、自主系统、定向能武器、机器人、生物技术。 本质上是战争逻辑变了: 下一场冲突不一定从前线开打,很可能先从海底光缆、地下指挥所、低轨星链和月球轨道爆发, 也就是说谁先定义了“新战场”,谁就能在接下来十年直接垄断军费预算。 ③ 软硬一体的组合拳:一边画蓝图,一边建“机器人司令部” 就在宣布子午线计划的同时,军方还宣布新建四星级的“自主战争司令部”(AUTOWARCOM)。 卧槽这是一套绝妙的闭环啊: ▫️Project Meridian 负责告诉军队“未来要买什么” ▫️自主战争司令部 负责“把无人机和机器人战争正式编进部队编制并负责买单” 美军正在从“造航母、造战机的平台军”,彻底转向“拼算法、拼传感器、拼杀伤链的软件军”。 但整件事最硬核的争议,在于它的利益结构: 这等于让供应商自己写五角大楼的采购清单。 马斯克手里有 SpaceX 和星链,Luckey 手里有 Anduril 自主武器,两人本身就是五角大楼核心订单的争夺者。 支持者会说:只有真正造出星链和自主无人机的人,才懂未来仗怎么打; 反对者会说:这完全是既当裁判又当运动员,把国家战略写成了自家公司的产品路线图。 当然咱们照例泼三盆冷水: 第一,120 天是政治速度,解决不了真正的硬骨头 120 天足够画出一张技术愿望清单,但根本解决不了供应链断裂、军队编制阻力、交战伦理规则以及盟友协同等深层死结。 第二,马斯克完成了危险的角色切换 上一轮做 DOGE 是砍预算得罪官僚,这一轮做 Meridian 是给军方画新大饼、分新蛋糕。 虽然政治上阻力更小,但也意味着他被前所未有地深绑进了美国最高国家安全机器,“局外科技极客”的保护色彻底褪去。 第三,传统军工利益集团不会坐以待毙 洛克希德·马丁、雷神等老牌巨头拥有极深的国会游说网络,一份外包报告能不能跨过国会预算这道坎,仍是巨大未知数。 最后给大家小结收个尾: 别只把这段视频当成“马斯克站起来领掌”的八卦。 五角大楼已经公开把未来战争的画笔交给了硅谷极客。 真正决定未来十几年几千亿美元军费流向的,就是 120 天后那份报告里被定为“必须主导”的几行字。 你看好硅谷极客重构军事体系,还是觉得这只是一场政治秀呢?欢迎评论区聊聊👇

    推荐理由:原文把人事任命、研究范围和新建司令部拼在一起,读者可以借此看清硅谷力量介入军费采购的利益结构。

  2. AYi71

    美国战争部长 Pete Hegseth 在"部队国情咨文"上宣布,马斯克将与 Anduril 创始人 Palmer Luckey、前众议长 Newt Gingrich 共同领导 Project Meridian,需在 2027 年 1 月底前提交公开报告和机密附件。

    引用DogeDesigner@cb_doge

    Elon Musk joined today’s State of the Force address, where War Secretary Pete Hegseth announced that Elon will co-lead Project Meridian to help shape the future of warfare. 🇺🇸

    推荐理由:原文把人事任命拆出分工、研究范围和争议点,读者可以据此理解五角大楼采购逻辑转变的背景。

  3. The Verge · AI77

    Trump 与六大科技公司签署前沿责任联合承诺,以自律取代联邦 AI 监管

    Trump 在与科技巨头晚宴后宣布不推联邦 AI 监管,Google、Anthropic、Meta、OpenAI、xAI 和 Nvidia 六家公司签署'道义约束'性质的前沿责任联合承诺(Joint Commitment on Frontier Responsibilities),由企业自我监管、无明确违规后果。

    推荐理由:原文汇集了六家头部公司负责人对自律式安全承诺的原话表态,便于对比各家立场差异。

9月30日周三
  1. 晚点LatePost · 微信公众号72

    晚点调查:从 ZCode 上传数据事件到 AI 个人助理,用户数据的边界在哪里

    《晚点》复盘智谱 ZCode 默认上传用户 .git 项目历史的事件,涉事存储桶已删除、智谱道歉并向用户补偿 Token,并对比 xAI Grok Build 的类似行为。

    推荐理由:以 ZCode 和 Grok Build 上传事件为切口,拆解 7 款 AI 产品协议条款,帮读者理解 AI 个人助理时代的隐私边界问题。

9月4日周五
  1. xAI News68

    xAI 如何为持久化智能体设计 Grok Bot 界面

    xAI 介绍 Grok Bot 的设计思路,界面以 Bot 而非会话为核心,每个 Bot 拥有名字、头像、记忆和自己的电脑与工具。Grok Bot 把产品概念收敛为 Bot、Chat、Prompt、Tool、Artifact 五个,工具与技能放在账号级,记忆与 Routine 归 Bot 级,并设定每个账号约 50 个 Bot、每个群聊 6 个的上限。

    推荐理由:xAI 复盘 Grok Bot 的界面取舍,展示持久化智能体如何从以会话为中心转向以 Bot 为中心。

9月3日周四
  1. @kimmonismus67

    前沿模型竞争格局在很短时间内从 OpenAI 与 Anthropic 双强之争,扩展为 OpenAI、Anthropic、xAI、Meta 多方并跑、Google 重新加入的局面,中国开源权重模型也紧随其后。

    引用@ArtificialAnlys@ArtificialAnlys

    Meta has released Muse Spark 1.3, their fourth Muse Spark model release in five months. Muse Spark 1.3 (max), which is in limited preview for Meta’s partners, scores 62 on the Artificial Analysis Intelligence Index, behind only Claude Fable 5.1 and Claude Opus 5. The variant available now, Muse Spark 1.3 (xhigh), scores 61 and ties with GPT-5.6 Sol (max) and Grok 4.6 (high). Both variants’ gains come primarily from improvements in agentic work and scientific capabilities Muse Spark 1.3 (xhigh) enters the Artificial Analysis Intelligence Index at 61, up 4 points from Muse Spark 1.2 (57, August) and 8 points from Muse Spark 1.1 (53, July). It enters tied with GPT-5.6 Sol (max), Grok 4.6 (high), and Claude Opus 5 (high), and behind Claude Fable 5.1 (max, 66), Claude Opus 5 (max, 63), and Claude Fable 5 (max, 62) Muse Spark 1.3 (max), which is in a limited preview stage, lands at 62. This higher index score is enabled by gains vs. Muse Spark 1.3 (xhigh) in Tau3-Bench Banking (52% vs. 47%) and GDPval-AA v2 (1,754 Elo vs. 1,709). Muse Spark 1.3 (max) is second only to Claude’s Fable and Opus variants in total score Congratulations to @AIatMeta, @finkd, and @alexandr_wang on the release! Key Takeaways: ➤ Continued improvement on agentic knowledge work tasks. At the launch of Muse Spark 1.2, we noted its significant gains in agentic knowledge work performance vs. Muse Spark 1.1. The latest iteration continues this trend, with Muse Spark 1.3 (xhigh) demonstrating a notable 12-point gain vs. Muse Spark 1.2 in Tau3-Bench Banking (35% to 47%), a 5-point gain in Terminal-Bench 2.1 (80% to 85%), and a new GDPval-AA v2 Elo of 1709 against its predecessor’s 1615. Muse Spark 1.3 (max) improves further on Tau3-Bench Banking (52%) and GDPval-AA v2 (1,754 Elo). This Tau3-Bench Banking score is #1 among all models. Muse Spark 1.3 (max) achieves these higher agentic work scores by using more turns and total reasoning tokens, reasoning 62% more on GDPval-AA v2 and 28% more on Tau3-Bench Banking compared to Muse Spark 1.3 (xhigh) ➤ The lowest cost per task for any model at 59+ on the Artificial Analysis Intelligence Index. Muse Spark 1.3 (xhigh) costs $0.55 per Intelligence Index task at Meta's unchanged $1.25/$4.25 per 1M token pricing ($0.15 for cached input), with its peers GPT-5.6 Sol (max) and Grok 4.6 (high) costing $0.95 and $0.94 respectively, a 70%+ premium. This places Muse Spark 1.3 (xhigh) on the Pareto frontier for Intelligence vs. Cost per Task. Its cost per task is higher than Muse Spark 1.2 ($0.40 per task), driven by ~57% more input tokens per task on agentic evaluations, with output tokens up only ~8%. Pricing for Muse Spark 1.3 (max) is not yet publicly available ➤ Scientific Reasoning results rose across the board, led by CritPt. CritPt was the standout non-agentic score gain vs. Muse Spark 1.2, with a material +8 points for the xhigh variant (18% to 26%), and GPQA Diamond achieved +4 points (90% to 94%), while Humanity’s Last Exam and SciCode each gained a more modest 2-3 points (45% to 47% and 56% to 59%, respectively). Muse Spark 1.3 (max) achieved roughly similar scores to the xhigh variant, gaining 2 points in Humanity’s Last Exam, tying on GPQA Diamond, and losing a point on CritPt vs. Muse Spark 1.3 (xhigh) ➤ Minor regressions in only two evaluations. Both Muse Spark 1.3 (xhigh) and Muse Spark 1.3 (max) dropped 4 points in AA-LCR (83% to 79%) when compared to Muse Spark 1.2, and AA-Omniscience (Accuracy) fell 3 points for xhigh and 1 point for max. The drops in AA-Omniscience (Accuracy) are due to a higher abstention rate (not answering questions when unsure), which also lowered the hallucination rate for Muse Spark 1.3 (xhigh) Other model details (xhigh variant): ➤ Context window: 1M tokens, unchanged from Muse Spark 1.2 ➤ Pricing: unchanged from Muse Spark 1.2: $1.25/$4.25 per 1M input/output tokens, with cache hits discounted to $0.15 per 1M ➤ Input modalities: text, image, video ➤ Availability: Meta's first-party API and Muse Code

    推荐理由:作者把前沿模型竞争格局的变化讲清楚,并指出中国开源权重模型已贴近第一梯队,可与2025年的撞墙争论对照。

9月2日周三
9月1日周二
8月29日周六
  1. @AYi_AInotes70

    Grok Bot 更新后接入 Stripe Link 钱包,能根据一句话需求在云端连接电商网站比价、加购物车、填收货地址,再弹出账单请款,用户点批准后生成一次性虚拟卡付款。其真实银行卡号对 Bot 不可见,每笔支出都需用户本人授权,目前已在美区桌面端全量上线。

    原始视频预览图;未保存可播放视频URL

    推荐理由:材料呈现了 Grok Bot 用 Stripe Link 走完比价、加购到一次性虚拟卡付款的流程,可看消费级智能体的支付环节如何设计。

  2. @frxiaobei74

    OpenAI 宣布终止与 Cursor 的合作,按提案 Cursor 对其模型的直接访问将于 11 月 12 日结束,OpenAI 表示会支持受影响的开发者过渡。

    引用@OpenAI@OpenAI

    We’re ending our partnership with Cursor following its acquisition by SpaceX. Under our proposal, Cursor’s direct access to our models would end on November 12. We know that the people most affected by this decision are the developers who rely on OpenAI models in Cursor. We care about their experience in this transition and we’re ready to go above and beyond to support them. https://t.co/OzuCTzUjfX

    推荐理由:作者把 Windsurf 与 Cursor 被断供、被收购的相反顺序摆在一起,便于观察独立编码工具的处境。

  3. 机器之心 · 微信公众号83

    OpenAI 宣布终止与 Cursor 合作,11 月 12 日起停止模型直接访问

    OpenAI 发布声明宣布终止与 Cursor 的合作,Cursor 对其模型的直接访问将于 11 月 12 日结束,理由是 Cursor 被 SpaceX 收购后,OpenAI 无法确信其会在服务条款范围内使用相关技术。

    推荐理由:OpenAI 断供 Cursor 与 Anthropic 此前切断竞品访问的做法前后呼应,读者可看到模型访问权正被当作竞争手段。

8月27日周四
  1. Michael Truell65

    Michael Truell 宣布 Grok Bot 现已向所有标准 Grok 或 Cursor 订阅用户开放,并表示其增长快于他们见过的任何产品。引用内容提到所有 SuperGrok 和 Cursor Pro 订阅者已可用 Grok Bot,且为所有用户重置了每周使用限额。作者称用户把电商运营(支持、广告、库存、财务)、协调客户活动、测试生产软件等任务交给 Grok Bot。

    引用Grok Bot@bot

    All SuperGrok and Cursor Pro subscribers now have access to Grok Bot. We're also resetting weekly usage limits for all users. Enjoy!

    推荐理由:作者列出用户实际交给 Grok Bot 的任务范围,读者可据此判断它在真实工作流中的落地程度。

8月26日周三
8月22日周六