LLM 为什么会忽略长提示词中间的信息:lost in the middle 效应解读
ByteByteGo 撰文解读 LLM 的 lost in the middle 盲点:信息在上下文窗口内可用,不代表会被有效使用。2023 年发布的 Lost in the Middle 研究发现准确率呈 U 形曲线,开头和结尾的信息更容易被利用,中间位置较弱。
blog.bytebytego.com · 网站与博客
ByteByteGo 撰文解读 LLM 的 lost in the middle 盲点:信息在上下文窗口内可用,不代表会被有效使用。2023 年发布的 Lost in the Middle 研究发现准确率呈 U 形曲线,开头和结尾的信息更容易被利用,中间位置较弱。
ByteByteGo 与 Salesforce 高级总监 Manjeet Singh 合作的直播实战课程 AI Evals in Practice 将于 3 天后截止报名,课程聚焦为生产环境 AI 智能体构建可靠评估系统。
SSH 通过 TCP 连接让客户端安全访问远程机器,双方交换版本、协商加密算法并各自独立推导会话密钥,密钥从不在网络上传输。服务器发送公钥和签名,客户端用 known_hosts 校验主机密钥,随后客户端以公钥登录并用私钥签名认证请求,私钥始终留在本机。
DoorDash 工程团队构建了共享的 Agent Gateway,统一控制 AI Agent 对工具的发现与调用,覆盖认证授权、凭证注入、工具目录筛选和监控审计。
LLM 的幻觉是指生成内容与事实不符、凭空编造或与给定材料相矛盾,例如把公司 14 天退款政策说成 30 天并虚构 5 个工作日到账承诺。文章将错误分为事实性幻觉、忠实性幻觉和编造三类,并解释逐 token 预测文本的机制为何会产出虚构事实。
Stripe 与 Tempo 联合发起的 Machine Payments Protocol(MPP)于 2026 年 3 月上线并提交 IETF,通过 HTTP 402 加 WWW-Authenticate: Payment、Authorization: Payment 和 Payment-Receipt 三个头部,让 AI Agent 无需注册账号即可按请求付费。
TypeSafe AI 的首个 System One Model Jev 比前沿 LLM 快 100 倍、成本低 100 倍,适合承担 LLM 周边的决策类任务。文章列出 9 个替代场景:模型路由、护栏检测、工具调用权限分类、收件箱分类、重排序、LLM 评测打分、批量打标、实时决策和置信度门控。核心思路是让 LLM 负责生成,Jev 负责围绕生成的决策。
ByteByteGo Live 推出「用 AI 重建 YouTube」课程,由前 YouTube 工程师授课,9 月 26 日(周六)开课,报名 24 小时后截止。
当提示词和 RAG 无法消除模型在特定任务上的反复偏差时,就需要通过微调把期望行为固化进模型参数。文章梳理了定制模型的路径:先用 few-shot prompting 和检索增强生成(RAG)补充信息,再用监督微调(SFT)训练模型,而 LoRA 和 QLoRA 通过减少需要调整的参数和显存占用,让微调现有模型更易落地。
OpenAI 于 2026 年 7 月发布全双工语音模型 GPT-Live-1,可同时听和说,无需轮次检测器。
ByteByteGo 撰文讲解如何在普通硬件上运行大模型推理。文章解释内存容量、带宽和 prefill 与 decoding 两阶段的瓶颈,并逐一介绍量化(8B 模型 16-bit 权重约 16 GB。
ByteByteGo 发布 API 概念速览,指出多数工程师日常调用 API,但设计可靠的 API 更复杂。内容涵盖 HTTP 方法、状态码、请求与响应格式等基础细节,以及 REST、GraphQL、gRPC、webhooks、WebSockets 的适用场景,并涉及命名、分页、版本控制、错误响应、向后兼容、API keys、OAuth、JWT、超时、重试、幂等性、限流、缓存、文档与契约测试。
ByteByteGo 详解 LLM 应用中的检索问题,以员工询问航班取消后酒店报销为例,说明 RAG 如何从数千份文档中找到正确且仍然有效的政策条款。文章覆盖 chunking 粒度权衡、嵌入向量的语义匹配、余弦相似度等度量选择、Flat/IVF/HNSW 索引的速度与召回权衡、元数据过滤的先筛后筛取舍,以及政策更新时的版本切换和混合检索加 reranking 的最后优化步骤。
ByteByteGo 重启为期 2 天的 Build with Claude Code 强化课程,由曾培训 Meta 数百名工程师的 John Kim 主讲,9 月 16 日开课,报名 24 小时后截止。
ByteByteGo 发文解释 LLM 为何在新会话中忘记此前对话:模型本身没有持久记忆,记忆错觉由围绕模型的应用通过重建上下文实现。文章区分训练记忆、上下文窗口工作记忆和外部持久记忆,分析上下文填满后的处理方式与长对话成本,并介绍滑窗、对话摘要、结构化实体抽取、向量库检索和长期用户画像等扩展记忆的技术。
LLM 输出具有非确定性、质量多维且依赖上下文,传统确定性测试无法覆盖,因此需要结合常规软件测试、精选数据集、自动化指标、模型评判、人工审核与生产监控构建评估体系。LLM-as-a-Judge 即用一个语言模型评估另一个语言模型的输出,但评判模型本身不足以构成完整方案。
git revert 不重写历史,而是新建一个提交来撤销早先提交的改动,因此当后续提交修改了同一批代码行时就会触发冲突。例如 C2 添加功能、C3 又改了这些行,撤销 C2 便会与 C3 的改动相撞,Git 无法判断哪个版本正确。解决方式是运行 git revert C2,在冲突处暂停后手动修改文件、暂存并继续,最终生成一个干净撤销 C2 且保留 C3 的新提交。
ByteByteGo 推出直播课程平台 ByteByteGo Live,主打直播课完课率约 40%,远高于多数线上课程的约 4%。
ByteByteGo 讲解智能模型路由,按请求难度把简单任务分给小模型、复杂任务分给强模型,算例显示 85% 请求走小模型、10% 走中等、5% 走强模型时平均成本约为全用强模型的 11%,接近 10 倍节省。文章覆盖小模型当路由器、级联先用便宜模型再校验升级、语义路由、基于真实数据的 learned routing,以及欠路由、过度路由、用户操纵路由规则等常见失败方式。
ByteByteGo 的文章梳理 LLM 应用的错误处理与容错设计,把失败划分为技术性失败和语义性失败两类,前者如网络中断、超时、429 限流和 5xx 服务故障,后者包括返回非 JSON、模型幻觉或工具调用参数错误。
ByteByteGo 新一期系统设计速览对比了 MCP、RAG 与 AI Agent:MCP 是连接 AI 模型与外部工具、数据源(API、数据库、Gmail、Slack、GitHub)的开放标准协议;RAG 在查询到来时从文档、PDF、数据库等外部数据源拉取最新信息;AI Agent 则自主执行任务并做决策,而非聊天机器人的请求-响应模式。
RAG 系统的检索质量由嵌入模型决定,语言模型再强也无法修复糟糕的检索。嵌入模型把文本转成向量并按语义相近度排序,例如把“yearly plan”匹配到“annual subscription”,但可能让“45 天前购买的订阅能否退款”这类问题检索到错误片段。文章还讨论了 top-k 检索、非对称检索、商用 API 与本地模型的取舍,以及 Matryoshka 嵌入对向量维度的控制。
一个 70B 参数模型以 16 位存储需约 140 GB,而消费级显卡显存仅 24 GB 或 48 GB,模型规模几年间增长约 100 倍而显存仅翻倍。文章介绍三种压缩技术:量化(用更少位数存储每个权重)、剪枝(删除无贡献的权重)和知识蒸馏(用小模型模仿大模型行为),并讨论压缩是否会损害模型智能。
在典型 LLM 中,一条消息要经过约十几个不同阶段才会开始输出回复,模型收到的并非用户原样输入的句子,而是临时拼装的一份文档,包含系统提示词、工具定义、记忆、检索文档和完整对话历史。模型本身无状态,每轮都要把历史重新完整发送,输入 token 随轮次累积,因此输入通常主导对话产品的总成本。
投机解码通过让一个小模型预先产出多个候选 token,再由大模型单次前向传播一次性评估全部候选,把生成速度提升 2-3 倍,且输出在统计上与单独运行大模型完全一致。以 16-bit 精度存储的 70B 模型每生成一个 token 需从显存读取约 140 GB 权重,token 生成阶段算力利用率仅 20%-40%,投机解码正是利用这部分闲置算力。
2026 年 8 月,MATS Research、ELLIS Institute Tübingen 与 Max Planck Institute for Intelligent Systems 的研究者测试了 Anthropic、OpenAI 和 Google 返回给客户端的加密推理块,发现把块重放进同族更便宜的模型,就能让隐藏推理以明文输出。
推荐理由:研究揭示加密推理块可被同族小模型复述,公开 agent 日志里的密钥无法靠清洗明文保护。
Sonar CTO Andrea Malagodi 谈 AI 时代代码验证:AI 让写代码变快,验证却成为更难的环节。Google DORA 研究显示团队采用更多 AI 后交付稳定性下降,超过三分之一开发者对 AI 生成代码缺乏信心;METR 对照试验中,资深开源开发者预期 AI 提速约 25%,实际任务耗时反而增加约 19%。
ByteByteGo 对比了 Ollama、vLLM、SGLang 三种开源权重模型推理引擎的请求处理方式。
GraphRAG 专为"全局查询"设计:标准 RAG 靠向量相似度只能检索到与问题措辞相近的片段,无法回答"所有事故复盘中哪些故障原因反复出现"这类需要通览整个语料的问题。
Thinking Machines 于 7 月 15 日发布的 Inkling 采用 66 层 MoE 架构,总参数 9750 亿、每个 token 约激活 410 亿,支持 100 万 token 上下文窗口。
Waymo 与 Tesla 采用两种不同的自动驾驶构建路线:Waymo 第六代系统配备 13 个摄像头、4 个 lidar、6 个雷达,覆盖 500 米,截至 2026 年 3 月累计无人驾驶里程 2.206 亿英里;Tesla 则坚持纯视觉方案,依赖摄像头与神经网络,在美国拥有超 300 万辆车、年行驶超 300 亿英里,2026 年第一季度 FSD 订阅数达 128 万。
Google 在 Cloud Next '26 上发布第 8 代 TPU,首次分为训练版 TPU 8t 和推理版 TPU 8i 两种型号。TPU 是 Google 专为深度学习矩阵乘法从零设计的自研 AI 芯片,与先为图形而生的 GPU 不同。两款芯片共用 Axion CPU、液冷和软件栈,代码可互相通用。
随着 AI 生成代码变得廉价,GitHub、Vercel、Replit 正围绕代码生成之后的难题重建平台。
Cloudflare 利用自身的反向代理位置,在边缘处于源站响应前完成自动化流量的身份验证、许可与付费结算,让 AI 爬虫为访问内容付钱。其 x402 协议沿用 HTTP 402 状态码,客户端收到价格与收款地址后附带支付凭证重发请求,由 facilitator 验证,单次支付可小到不足一美分。
LinkedIn、Meta 和 YouTube 过去两年都在重建检索阶段,用基于语义的嵌入向量匹配替代互动量信号,以削弱标题党内容的传播优势。LinkedIn 将五套检索系统合并为单一语言模型检索器,Meta 保留由多个专用模型组成的漏斗式架构,YouTube 则采用生成式方法直接产出下一个内容的标识符。文章还讨论了冷启动问题及预训练在用户历史稀疏时的作用。
知识蒸馏通过让小型学生模型学习大型教师模型的软标签(如 cat 0.70、dog 0.25、fox 0.05 的概率分布)来训练新模型,而非压缩已有模型。Google 的 Gemma 系列即在训练中借助 Gemini 家族的大模型完成蒸馏,学生模型可部署于手机或单一服务,响应更快、单次请求成本更低。
LLM 长上下文推理的成本主要来自 KV cache:它随 token 数和批量大小线性增长,解码阶段每生成一个 token 都要读取整个缓存,缓存越大带宽开销越高。
LLM 几乎所有漏洞都源于同一特性:模型把指令和数据当作同一串 token 处理,序列中没有任何标记区分命令与信息,提示词注入由此而来。
ByteByteGo 正在招聘"用 AI 编写生产级代码"课程的兼职讲师,这是一门面向软件工程师的直播小班课,教授如何用编码智能体可靠交付生产级软件。讲师需协助完善课程、直播授课并答疑,每两周投入约 2 到 10 小时,薪酬视经验而定。要求 5 年以上生产系统开发经验,日常使用 Claude Code、Codex、Cursor 等编码智能体,并熟悉规划、工具调用、上下文管理及常见失败模式。
ByteByteGo 访谈 OpenAI 工程师,详解 Codex 与 ChatGPT Work 背后的智能体循环如何在 harness、API 和推理三层做效率优化。
推荐理由:沿一次请求穿过的三层链路,拆解 OpenAI 在 harness、API 与推理层的具体优化手法,可迁移到自建 Agent 系统。