前言

这篇文章用最直白的方式讲清楚:AI 为什么聊着聊着就忘了你是谁、128K 和 1M 到底是什么、Agent 又干了什么。 不用任何技术背景,读完就能跟别人讲明白。


一、上下文就是 AI 的"记性"

你跟 AI 聊天,问一句答一句。上下文就是它一次能记住的对话总量。

你:我叫小张
AI:好的,小张

你:我喜欢吃火锅
AI:记住了,小张爱吃火锅

你:我今年 28
AI:28 岁的小张,爱火锅

...聊了一百轮之后...

你:我叫什么?
AI:不好意思,我不记得你是谁
     ↑ 最早那条"我叫小张"已经被挤出去了

就像微信聊天记录。往上翻 10 条能看到,往上翻 500 条就翻不动了。

上下文窗口 = “最多能往上翻多少”。


二、为什么会有这个限制?

AI 跑在 GPU 上,GPU 有一个硬件的存储空间叫显存

你问一句话   → 占一点点显存
AI 记在心里  → 占一点点显存
你问下一句   → 又占一点点显存
...

聊到第几千句 → 显存满了 → 报错或忘掉最早的消息

为什么不能无限制?因为 AI 的注意力机制是 O(n²) 的:

对话量翻一倍  →  计算量翻四倍
对话量翻十倍  →  计算量翻一百倍

GPU 撑不住,就只能设一个上限。


三、128K 和 1M 是什么意思

K = 千,M = 百万。这里的数字指的是 token 数。
一个中文字大概 1-2 个 token,约等于一个汉字。

上下文大小 能记住多少
128K token 约 150 页的对话
1M token 约 1200 页的对话

一部《三体》三本约 90 万字 ≈ 1M token。

所以 128K 的模型读不完一整本小说,1M 可以。


四、为什么 1M 最近才有?

以前做不到,三个原因:

① 显存放不下

128K 上下文 ≈ 2GB 显存
1M   上下文 ≈ 16GB 显存

一张 GPU 总共就 80GB 显存,1M 上下文就要吃掉 16GB。以前显存更小,根本塞不下。

② 计算太慢了

128K → 够算
1M   → 要算 64 倍 → 一分钟才能回你一句话

谁受得了等一分钟?直到 Flash Attention 这些新技术出来,把速度提了十几倍,1M 才变得能用了。

③ 以前没人需要

在 Claude Code 这种"长对话 Agent"出现之前,大家跟 AI 聊天最多十几轮就结束了。没需求就没动力去搞 1M。

2024 年是分水岭:Gemini 1.5 第一个喊出 1M,之后各家跟上来。前置技术(更聪明的算法、更大的显存、位置编码改进)刚好在这一年凑齐了。


五、Agent 干了什么?——在有限空间里"收纳"

模型给的记性上限是 128K,但 Agent 不可能真的塞满,因为它还要留空间给回复。

Agent 做的事就像小户型收纳

房子就 30 平(上下文 128K)

策略 1:扔东西
  → 工具返回了 5000 行的日志
  → 只留前 20 行,后面全砍掉

策略 2:做摘要
  → 聊了 50 句代码 bug
  → 压成一句话:"修了登录页一个 CSS bug"

策略 3:装不下就喊停
  → "上下文满了,请把任务拆小再试"

Agent 不创造空间,只管理空间。 房子是 30 平就是 30 平,收纳再厉害也变不出 100 平。


六、限制在模型,不在 Agent

┌──────────────────────────┐
│  模型(盖房子的)         │
│  决定了:最多 128K 还是 1M │
│  Agent 改不了这个         │
├──────────────────────────┤
│  Agent(搞收纳的)        │
│  决定了:怎么在限额内省着用 │
│  删旧消息、做摘要、喊停    │
└──────────────────────────┘

模型升到 1M = 房子从 30 平变成 300 平。Agent 一行代码不用改,自动住得更宽敞。


七、三个记住就行

上下文 = AI 一次能记住多少对话。记性有限,不是无限聊。

128K / 1M = 记性大小的单位。越大越贵越难做,但聊起来越爽。

Agent = 收纳师。空间有限就帮你省着用,但不可能无中生有。


Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐