AI 上下文限制到底是怎么回事——用最直白的话讲明白 128K、1M 和 Agent
文章目录
前言
这篇文章用最直白的方式讲清楚:AI 为什么聊着聊着就忘了你是谁、128K 和 1M 到底是什么、Agent 又干了什么。 不用任何技术背景,读完就能跟别人讲明白。
一、上下文就是 AI 的"记性"
你跟 AI 聊天,问一句答一句。上下文就是它一次能记住的对话总量。
你:我叫小张
AI:好的,小张
你:我喜欢吃火锅
AI:记住了,小张爱吃火锅
你:我今年 28
AI:28 岁的小张,爱火锅
...聊了一百轮之后...
你:我叫什么?
AI:不好意思,我不记得你是谁
↑ 最早那条"我叫小张"已经被挤出去了
就像微信聊天记录。往上翻 10 条能看到,往上翻 500 条就翻不动了。
上下文窗口 = “最多能往上翻多少”。
二、为什么会有这个限制?
AI 跑在 GPU 上,GPU 有一个硬件的存储空间叫显存。
你问一句话 → 占一点点显存
AI 记在心里 → 占一点点显存
你问下一句 → 又占一点点显存
...
聊到第几千句 → 显存满了 → 报错或忘掉最早的消息
为什么不能无限制?因为 AI 的注意力机制是 O(n²) 的:
对话量翻一倍 → 计算量翻四倍
对话量翻十倍 → 计算量翻一百倍
GPU 撑不住,就只能设一个上限。
三、128K 和 1M 是什么意思
K = 千,M = 百万。这里的数字指的是 token 数。
一个中文字大概 1-2 个 token,约等于一个汉字。
| 上下文大小 | 能记住多少 |
|---|---|
| 128K token | 约 150 页的对话 |
| 1M token | 约 1200 页的对话 |
一部《三体》三本约 90 万字 ≈ 1M token。
所以 128K 的模型读不完一整本小说,1M 可以。
四、为什么 1M 最近才有?
以前做不到,三个原因:
① 显存放不下
128K 上下文 ≈ 2GB 显存
1M 上下文 ≈ 16GB 显存
一张 GPU 总共就 80GB 显存,1M 上下文就要吃掉 16GB。以前显存更小,根本塞不下。
② 计算太慢了
128K → 够算
1M → 要算 64 倍 → 一分钟才能回你一句话
谁受得了等一分钟?直到 Flash Attention 这些新技术出来,把速度提了十几倍,1M 才变得能用了。
③ 以前没人需要
在 Claude Code 这种"长对话 Agent"出现之前,大家跟 AI 聊天最多十几轮就结束了。没需求就没动力去搞 1M。
2024 年是分水岭:Gemini 1.5 第一个喊出 1M,之后各家跟上来。前置技术(更聪明的算法、更大的显存、位置编码改进)刚好在这一年凑齐了。
五、Agent 干了什么?——在有限空间里"收纳"
模型给的记性上限是 128K,但 Agent 不可能真的塞满,因为它还要留空间给回复。
Agent 做的事就像小户型收纳:
房子就 30 平(上下文 128K)
策略 1:扔东西
→ 工具返回了 5000 行的日志
→ 只留前 20 行,后面全砍掉
策略 2:做摘要
→ 聊了 50 句代码 bug
→ 压成一句话:"修了登录页一个 CSS bug"
策略 3:装不下就喊停
→ "上下文满了,请把任务拆小再试"
Agent 不创造空间,只管理空间。 房子是 30 平就是 30 平,收纳再厉害也变不出 100 平。
六、限制在模型,不在 Agent
┌──────────────────────────┐
│ 模型(盖房子的) │
│ 决定了:最多 128K 还是 1M │
│ Agent 改不了这个 │
├──────────────────────────┤
│ Agent(搞收纳的) │
│ 决定了:怎么在限额内省着用 │
│ 删旧消息、做摘要、喊停 │
└──────────────────────────┘
模型升到 1M = 房子从 30 平变成 300 平。Agent 一行代码不用改,自动住得更宽敞。
七、三个记住就行
上下文 = AI 一次能记住多少对话。记性有限,不是无限聊。
128K / 1M = 记性大小的单位。越大越贵越难做,但聊起来越爽。
Agent = 收纳师。空间有限就帮你省着用,但不可能无中生有。
更多推荐



所有评论(0)