Grok Bot 演示了示教学习能力:工程师在 Google Slides 里手动做一遍动画排版,Grok Bot 在后台记录视觉变化与点击轨迹,完成后封装成可调用的专属技能,下次同类需求由 Bot 自行执行。该方式让人类无需再写长篇提示词描述界面位置,但录制的仅是顺风局操作轨迹,遇到网页改版或意外弹窗会卡住,且它只学会怎么点、不理解为什么点。
以前想把一个公司内部流程教给 AI,你要么抓破脑袋写几页操作手册,要么求 IT 团队写代码排期。
Grok Bot 这个演示的狠活在于:你直接接管鼠标点一遍,它把你的肌肉动作直接逆向编译成能跑的工作流。
Grok Bot 看人类做一次 PPT 就学会流程的视频,很多人看完直呼 AI 成了精,但如果把那些神化 AI 偷师学艺的词剥掉,它真正解决的根本不是 AI 有多聪明, 而是终于不用逼着人类写三千字提示词,去向一个模型解释那个该死的按钮在屏幕什么位置了。
视频里的场景其实很接地气:
工程师直接接管电脑,在 Google Slides 里手动做一遍动画排版;
Grok Bot 在后台记录视觉变化与点击轨迹,做完之后直接封装成一个可调用的专属技能;
下次再碰到类似需求,Bot 顺着这个工作流自己跑。
真正值钱的转变不是 AI 拥有了开悟的灵性,而是人类知识输入的接口彻底变了。
过去想让自动化工具帮你干活,最痛苦的不是执行,而是交代任务:
你要截图、标红框、写长篇大论的提示词去描述界面;
而示教学习相当于给系统装上了三件套:
眼睛是多模态录屏器,扫过界面的每一个元素状态;
脑子是语义提取器,把一次性动作抽象成带参数的标准工序;
手是带容错的自动脚本,下次遇到同类任务照方抓药。
你用最本能的肌肉记忆点一遍,就把深埋在脑子里的隐性流程全交接了。
但如果你以为从此所有岗位都能一键复制,有两个残酷的现实必须讲清:
第一,录制下来的只是顺风局的操作轨迹,一旦目标网页稍微改版、或者跳出一个意料之外的验证弹窗,缺乏异常处理分支的 Bot 会瞬间卡在原地;
第二,它学会的是怎么点,而不是为什么要点,当业务数据发生冲突时,它依然无法做价值取舍。
大模型最大的浪费,就是让懂业务的人天天在提示词里扮演人工编译器;
能把一次手动画面的操作变成长期复用的技能,确实把普通人做自动化的门槛打平了一大截。
但永远别担心自己的工作会被录两下就偷走,
能被轻易复刻的从来只是鼠标指针的位移,那个在关键时刻知道什么时候该打破流程的人,依然是你。 https://t.co/CyEEOiYc0T
来源:@AYi_AInotes · x.com