跳到正文
原文
AYi· @AYi_AInotes · X·· 6 小时前精选AI 评分80
AI 导读

Karpathy 发推分享理解大语言模型输出的技巧:让模型用受控语言 ASD-STE100 写作,或改用图表、交互 HTML 页面输出,他最看好为任意主题生成 3b1b 风格的自定义解释视频(可用 ElevenLabs API key 配旁白)。他认为随着 LLM 自主完成更多执行工作,人类工作将上移到监督与理解层面,且可以要求模型生成用后即弃的定制软件制品。作者阿易转述并解读了这条推文。

推荐理由

Karpathy 提出的四层输出格式阶梯和可抛弃软件制品概念,为理解大模型输出提供了可上手的做法。

正文

holy,这下爽飞了!!!前 @OpenAI 创始团队成员、@Tesla 特斯拉前 AI 总监、全网最受尊敬的 AI 布道大神 @karpathy Karpathy
刚公开了他私藏的大模型提效秘籍,我觉得他这次有点把大模型时代一个最反直觉的真相彻底撕开了,
喵个咪这不得把全网还在死磕长文提示词的人看傻了?!🤯。。

我给大家大白话讲清楚,
绝大多数人还在到处死磕怎么给 AI 写提示词,而现在真正顶级的 AI 玩家已经在全力解决怎么看懂 AI 吐出来的海量结果了兄弟们,

随着大模型越来越自主地把长链条的脏活累活全干完,人类的工作重心正在不可逆地从动手执行变成理解与监督,

但人类大脑读取纯文字的带宽极低,面对 AI 生成的几万字报告,人看两眼就头晕。

Karpathy 在这篇推文里直接亮出了他私藏的四层降维输出方案,层层递进,每一层都在把理解成本往下砸一个量级。

最直接的一个提示词技巧,是让 AI 用航空航天标准 ASD-STE100 来回答。

这是当年专门给飞机维修手册制定的受控语言规范,词汇和句式被死死焊在极度简短、毫无歧义的死板框架里,

大模型其实天生精通这套规范,输入时加上按 ASD-STE100 标准或按 80% 的严格度来解释,模型那些车轱辘话、模糊定性和自作聪明的倒装句当场被全部过滤,吐出来的文字干净得像手术刀。

但比看文字更舒服的做法,是直接逼模型画图,
遇到复杂的系统流转或架构关系,直接在结尾加上生成 Mermaid 流程图或 SVG 架构图,视觉皮层处理信息的速度比逐字逐句阅读快上几十倍。

再往上推一层,直接让模型输出单文件 HTML 交互页面。

现在的编程模型在前端能力上已经强到离谱,遇到晦涩的多维参数或逻辑推导,让它手搓一个带滑块调参、带实时动画、带交互过滤器的独立网页,你在浏览器里拖动两下,比看十页长篇大论要直观得多。

最狠的是 Karpathy 最看好的终极形态,给任意复杂概念生成 3Blue1Brown 风格的动态视频。

指令里直接写生成 3b1b 风格的数学动画代码,再挂上语音合成接口把解说配齐,把原本抽象枯燥的底层算法,直接变成几分钟带数学轨迹和专业旁白的动态科普片。

这里藏着全篇最具颠覆性的定义炸弹,叫可抛弃型软件制品。

放在以前,为了理解一个知识点去专门写个交互网页或做个 3D 动画,成本高到根本不现实,

但在代码和算力极其充裕的今天,为了让你弄懂一个概念,AI 可以随时为你手搓一个阅后即焚的专属软件。

以前我们把软件当成资产来维护,从今天起软件变成了阅后即丢的消耗品,代码的终局不是存进仓库,而是替你的大脑省下思考带宽。

这四种形态铁汁们平时用得最多的是哪种?我以前我天天看纯文本看到眼瞎,现在遇到复杂架构直接让它吐单文件 HTML,在浏览器里拖动几下比读半小时文档管用太多了hh

引用Andrej Karpathy@karpathy
We'll be spending a lot more time trying to understand the outputs of language models. A few thoughts, tips & tricks: Writing. Something I've had success with: Ask your LLM to explain something in ASD-STE100, it's a controlled language specification originally developed for aerospace maintenance documentation. LLMs well-versed in this language and it comes with heavy constraints on clean writing style that I often find a lot more readable. Sometimes I've tried to soften it a bit e.g. ask for "80% of the way to ASD-STE100" because the spec is quite stringent. But even better: Diagrams / images. Instead of writing, ask your LLM to create a diagram. These can be a lot easier to process, parse, and understand. But even better: Web pages. Ask for output "in HTML" to get a beautiful, interactive webpage. LLMs are getting really good at frontend and can create beautiful experiences, animations, etc. But even better: Explainer videos. The output format I am most bullish on is fully custom / bespoke explainer videos generated on any arbitrary topic. Experiment with things like "Create a 3b1b style video explainer on X. Use my ElevenLabs API key for audio narration". (you'd need an API key for the latter or you can ask your LLM to find you decent free alternatives that use your local compute). This is actually starting to work! In summary: - As LLMs get better, they will do more and more of the legwork autonomously, and a lot more of our work will rise up the abstractions into oversight and understanding. - Luckily, LLMs can help here too because as intelligence and code are increasingly abundant, you can ask for large, custom, discardable software artifacts (e.g. web apps, video explainers) that would have never made sense to create before. Push the boundaries here and you'll be surprised.
在 X 查看被引用的帖子

来源:AYi · x.com