文章目录

十年AI风云录:从Transformer到Agentic Coding(2015–2026)

前言

从深度学习的星火燎原,到大模型的百舸争流,再到Agent编程的范式革命。十年间,AI从实验室的小众课题变成了重塑千行百业的通用生产力。本文按年梳理技术演进、产品迭代与产业格局的关键节点,完整复盘这一轮AI浪潮的来龙去脉,看懂每一次技术突破背后的逻辑与影响。


2015:深度学习产业化元年,通用AI梦想启程

里程碑事件

2015年12月11日,OpenAI正式成立

美国旧金山,一家名为OpenAI的非营利性AI研究实验室正式挂牌成立。初始核心团队包括伊隆·马斯克、萨姆·阿尔特曼、伊利亚·苏茨克维等科技界与学术界知名人物,启动资金达10亿美元。
彼时的AI行业仍以垂直场景的深度学习应用为主,通用人工智能(AGI)还只是学术圈的小众话题。OpenAI的使命极具前瞻性——“以最有可能造福全人类的方式推进通用人工智能”,其非营利的定位也意在避免AI技术被少数巨头垄断。
没有人能预料到,这家带着理想主义色彩的实验室,会在七年后用一款产品彻底改变整个世界的科技走向。

2015年11月9日,谷歌开源TensorFlow深度学习框架

谷歌大脑团队正式将第二代深度学习框架TensorFlow开源,面向全球开发者免费提供。相比初代框架DistBelief,TensorFlow支持分布式训练、跨平台部署,接口设计更友好,工业级稳定性更强。
在此之前,深度学习开发门槛极高,研究者需要手动实现大量底层算子,小型团队几乎无法参与前沿研究。TensorFlow的开源,相当于给整个行业递了一把标准化的“铲子”,让更多开发者能够快速搭建、训练和部署深度学习模型,直接推动了后续五年深度学习的产业化普及。

2015年10月,AlphaGo首次击败人类职业围棋选手

DeepMind开发的人工智能程序AlphaGo,以5:0的战绩击败欧洲围棋冠军、职业二段选手樊麾。这是人工智能首次在全尺寸围棋棋盘上击败职业棋手,在此之前,业界普遍认为围棋的复杂度太高,AI至少还需要十年才能达到职业水平。
这场胜利并没有在大众层面引发太多关注,但在AI圈内已经掀起轩然大波——它证明了深度学习+强化学习的组合,能够在高度复杂的决策任务中超越人类经验,为后续AI向通用能力进化埋下了重要伏笔。

2015年9月,百度大脑正式对外开放

百度正式对外发布“百度大脑”平台,开放语音、图像、自然语言处理等核心AI能力接口。这是国内首个大规模对外开放的AI能力平台,标志着国内科技巨头正式从自研AI技术走向能力输出,拉开了中国AI产业化的序幕。
彼时百度是国内AI投入最大的公司,在语音识别、计算机视觉、自然语言处理三个方向均有深厚积累,其深度学习平台PaddlePaddle也在紧锣密鼓地研发中,成为国产AI框架的先行者。

技术动态

1. 计算机视觉:深度残差网络带来性能质变

2015年的ImageNet图像识别竞赛上,微软亚洲研究院提出的**ResNet(深度残差网络)**一举夺魁,Top-5错误率降至3.57%,首次超越人类肉眼识别水平。
ResNet提出的残差连接结构,彻底解决了深度神经网络训练中的“梯度消失”难题,让网络层数可以从几十层轻松扩展到上百层甚至上千层。这一设计不仅刷新了图像识别的精度天花板,更成为后续所有深度视觉模型的标准组件,甚至被沿用到大语言模型的架构设计中。
同年,目标检测、图像分割等细分领域也迎来快速突破,Faster R-CNN、U-Net等经典架构相继提出,计算机视觉技术开始具备工业落地的能力。

2. 自然语言处理:序列模型走向成熟

这一年的NLP领域仍以循环神经网络为主流,**LSTM(长短期记忆网络)**和GRU结构被广泛应用于机器翻译、文本生成、情感分析等任务。
9月,谷歌神经机器翻译系统(GNMT)立项,基于Seq2Seq+Attention的架构开始研发,目标是取代传统的统计机器翻译。相比传统方法,神经机器翻译能够更好地捕捉上下文语义,翻译流畅度大幅提升。
与此同时,词向量技术(Word2Vec、GloVe)已经成为NLP任务的标配,通过无监督训练得到的词向量,能够有效表征词语的语义关系,为后续预训练语言模型的出现打下了基础。但此时的NLP模型仍以“单任务微调”为主,一个模型通常只能做好一件事,通用语言理解还遥遥无期。

3. 深度学习框架生态初步形成

除了TensorFlow的横空出世,开源框架领域已经呈现百花齐放的态势:

  • Caffe:由伯克利视觉中心开发,是计算机视觉领域最流行的框架,上手简单、速度快,被大量创业公司采用;
  • Theano:蒙特利尔大学开发的符号计算框架,是早期深度学习研究的主流工具,很多创新算法都基于Theano验证;
  • Torch:基于Lua语言,以灵活的动态图著称,被DeepMind、Facebook AI等顶尖研究团队广泛使用,也是后来PyTorch的前身。
    框架的繁荣降低了深度学习的入门门槛,高校、创业公司、大厂都能快速参与到技术迭代中,整个行业的创新速度被显著加快。

4. 语音技术率先实现商用落地

语音识别是AI领域最早实现商业化的方向之一。2015年,科大讯飞的中文语音识别准确率已经达到95%以上,满足了大多数日常场景的使用需求,智能语音输入法、智能客服、车载语音等应用开始大规模普及。
谷歌、苹果、亚马逊也在智能语音助手赛道持续加码,Siri、Google Now功能不断完善,亚马逊Echo智能音箱开始在北美家庭渗透,语音交互被认为是下一代人机交互的入口。

5. 国内AI产业全面布局

除了百度大脑的开放,国内互联网巨头在2015年纷纷加大AI投入:

  • 阿里巴巴组建iDST(数据科学与技术研究院),重点布局机器学习、计算机视觉、语音交互等方向,为后续通义大模型积累技术底子;
  • 腾讯成立AI Lab(人工智能实验室),在深圳、西雅图同步设立研发中心,聚焦自然语言处理、计算机视觉、强化学习等基础研究;
  • 一批AI创业公司集中成立,商汤、旷视、依图等计算机视觉公司快速崛起,安防、金融成为AI落地的第一个主战场。

年度总结

2015年是深度学习从学术研究走向产业落地的关键转折点。
这一年,ResNet解决了深度网络的训练难题,TensorFlow降低了行业的参与门槛,AlphaGo证明了AI在复杂决策上的潜力,国内国外的科技公司都在疯狂加注AI赛道。整个行业还处在“感知智能”的阶段——AI能看、能听,但还不会思考、不会创作,通用人工智能还只是遥远的梦想。
但所有的伏笔都已经埋下:算力的提升、框架的普及、算法的突破、资本的涌入,一切都在为五年后的那场大爆发积蓄力量。站在十年后的视角回看,2015年更像是一场盛大演出的序章,真正的主角还没有登场,但舞台已经搭建完毕。


2016:AlphaGo破圈启蒙,AI从实验室走向大众视野

里程碑事件

2016年3月15日,AlphaGo战胜李世石,AI全民启蒙

韩国首尔,谷歌DeepMind的AlphaGo与世界围棋冠军李世石九段展开五番棋对决,最终以4:1的总比分获胜。这场比赛通过全球直播吸引了数亿人观看,成为AI发展史上最具标志性的破圈事件。
比赛过程中,AlphaGo走出的第37手“肩冲”震惊了所有围棋职业选手——这步棋完全不符合人类的围棋直觉,事后却被证明是制胜的关键。这一刻,全世界第一次直观感受到人工智能的“超越性”:它不仅能模仿人类,还能找到人类从未想到的解法。
这场比赛之后,“深度学习”“人工智能”从学术术语变成了大众热议的话题,资本、人才、政策开始向AI领域快速倾斜,全球AI产业进入加速车道。

2016年4月27日,OpenAI发布OpenAI Gym强化学习平台

OpenAI正式推出开源强化学习工具包OpenAI Gym,提供了一套标准化的强化学习环境与评测基准,涵盖经典控制、雅达利游戏、机器人控制等多种场景。
在此之前,强化学习研究的环境不统一,不同论文的结果难以对比复现。OpenAI Gym的出现统一了行业的“训练场”,极大降低了强化学习的研究门槛,推动了后续深度强化学习算法的快速迭代,也为AI在游戏、机器人、决策优化等领域的落地提供了基础工具。

2016年9月,谷歌发布神经机器翻译系统GNMT

谷歌正式推出基于深度神经网络的机器翻译系统GNMT,在中英翻译等多个语言对上,翻译质量相比传统统计方法提升了60%以上,错误率大幅降低,译文流畅度首次接近人类水平。
这是深度学习在自然语言处理领域的第一个大规模商用落地成果,它证明了神经网络能够有效处理复杂的序列生成任务,也让行业看到了生成式AI的商业潜力。随后几年,神经机器翻译快速普及,彻底改变了跨语言沟通的效率。

2016年11月,亚马逊AWS推出AI服务矩阵

亚马逊云服务AWS正式推出全面的AI服务组合,包括图像识别Rekognition、语音转文字Transcribe、文本转语音Polly、机器翻译Translate等,将AI能力以云服务的形式对外开放。
这标志着AI能力正式成为云计算的标配组件,企业不需要自己组建AI团队、训练模型,通过调用API就能获得顶尖的AI能力。这种“AI即服务”的模式,大幅降低了传统行业的AI应用门槛,也为后续大模型API的商业模式埋下了伏笔。

技术动态

1. 强化学习成为行业研究热点

AlphaGo的胜利带火了整个强化学习赛道,2016年也被称为“深度强化学习元年”。

  • 算法层面,DQN、策略梯度、Actor-Critic等经典深度强化学习算法被广泛研究,TRPO、PPO等更稳定的策略优化算法相继提出,其中PPO算法后来成为大模型RLHF训练的核心算法;
  • 应用层面,强化学习从游戏领域逐步延伸到机器人控制、推荐系统、资源调度、自动驾驶等真实场景,展现出强大的决策优化潜力;
  • 学界与工业界普遍认为,强化学习是实现通用人工智能的关键路径之一——它让AI能够通过与环境交互自主学习,而不是只依赖人类标注的数据。

2. 计算机视觉技术快速工业化

ResNet提出之后,计算机视觉技术进入快速落地期:

  • 人脸识别精度突破商用门槛,商汤、旷视等公司的人脸识别算法在公开数据集上屡破纪录,安防、门禁、金融核验成为第一批大规模落地场景;
  • 目标检测技术持续迭代,YOLOv1、SSD等一阶段检测算法相继提出,检测速度大幅提升,让实时视频分析成为可能;
  • 图像分割、OCR文字识别、人脸识别等技术逐步成熟,AI开始在安防、金融、医疗、零售等行业试点落地。

3. 生成式模型的早期探索

这一年的生成式AI还处于萌芽阶段,但已经出现了多个重要方向:

  • **GAN(生成对抗网络)**迎来爆发期,DCGAN、InfoGAN、CycleGAN等变体相继提出,生成图像的清晰度与多样性快速提升,文生图的技术路线开始显现雏形;
  • 文本生成领域,基于LSTM的语言模型已经能够生成连贯的短文本,但逻辑一致性差、长文本容易跑偏,距离实用还有很远距离;
  • 语音合成技术从拼接式转向参数式,WaveNet模型的提出让合成语音的自然度大幅提升,接近真人发音水平。

4. 深度学习框架持续迭代

TensorFlow在开源后迅速占领工业界市场,成为企业级深度学习部署的首选框架。与此同时,Facebook AI研究院在2016年开始基于Torch框架研发新一代动态图框架,也就是后来的PyTorch。
学术界与工业界开始出现分化:工业界偏爱TensorFlow的稳定性与部署能力,学术界则更青睐动态图框架的灵活性与易用性。这种框架之争持续了数年,也在客观上推动了深度学习技术的持续优化。

5. 国内AI产业加速追赶

2016年,国内AI产业进入高速发展期:

  • 政策层面,“人工智能”首次被写入“十三五”规划,上升为国家战略,各地纷纷出台AI扶持政策,产业园、孵化器遍地开花;
  • 资本层面,AI创业公司迎来融资热潮,计算机视觉、智能语音、自动驾驶是最热门的赛道,一批独角兽公司快速崛起;
  • 技术层面,国内团队在公开数据集上的排名不断提升,逐步从“跟跑”向“并跑”迈进,但底层算法与基础框架仍以海外为主。

年度总结

2016年是AI的全民启蒙之年。
一场围棋对战,让普通大众第一次认识到人工智能的强大潜力;资本与政策的加码,让AI从实验室走向了产业舞台的中央。这一年,AI的核心能力还是“感知”——识别图像、听懂语音、翻译文字,但它已经开始展现出“决策”与“生成”的潜力。
整个行业的乐观情绪空前高涨,所有人都相信AI将重塑各行各业,但没有人能说清下一个爆点会在哪里。没有人想到,真正颠覆世界的不是下棋的AI,也不是识别图像的AI,而是一个能聊天、能写代码的语言模型。


2017:Transformer横空出世,大模型时代的技术原点

里程碑事件

2017年6月12日,Transformer架构论文发表

谷歌大脑团队在论文《Attention Is All You Need》中正式提出Transformer架构,彻底改变了自然语言处理的技术路线,也为整个大模型时代奠定了技术基石。
在此之前,主流的序列模型都是基于RNN/LSTM架构,只能按顺序逐个处理词语,并行计算能力差,长序列依赖问题难以解决。Transformer抛弃了循环结构,完全依靠自注意力机制来捕捉序列中的依赖关系,不仅能并行计算大幅提升训练效率,还能有效捕捉长距离语义关联。
论文发表之初并没有引发大众关注,甚至被不少人认为只是“又一个增量改进”。但站在十年后的视角看,这篇论文的历史地位堪比计算机领域的图灵机架构——后续所有的GPT、Claude、Gemini,所有的大语言模型,全部建立在Transformer架构之上。

2017年10月19日,AlphaGo Zero问世,实现无人类知识自我进化

DeepMind发布AlphaGo Zero版本,它完全不需要人类棋谱数据,只通过自我对弈的强化学习,从零开始训练,仅用3天时间就以100:0的战绩击败了曾经战胜李世石的AlphaGo版本。
这一结果震惊了整个AI界:人类积累了上千年的围棋知识,AI只需要三天就能从零超越。它证明了强化学习的巨大潜力——只要规则明确、环境可模拟,AI就能摆脱人类经验的束缚,探索出远超人类认知的解法。
更重要的是,“从数据驱动到自主进化”的思路,为后续大模型的能力提升提供了重要启发,也为通用人工智能的实现路径增加了更多可能性。

2017年1月,PyTorch正式发布

Facebook AI研究院正式开源PyTorch深度学习框架,凭借简洁的API设计、灵活的动态图机制、直观的调试体验,迅速在学术界圈粉无数。
和TensorFlow的静态图模式不同,PyTorch采用动态计算图,代码编写逻辑和普通Python代码完全一致,调试方便,上手门槛极低。研究者可以快速验证新想法、实现新算法,极大加速了学术创新的速度。
PyTorch的出现形成了与TensorFlow分庭抗礼的格局,也倒逼TensorFlow后续推出Eager模式等动态图特性。在后续的大模型浪潮中,PyTorch逐步成为绝对主流,几乎所有前沿大模型研究都基于PyTorch开展。

2017年10月11日,阿里巴巴达摩院正式成立

阿里巴巴宣布成立达摩院,计划三年投入1000亿元人民币,布局基础科学与颠覆性技术研发,人工智能是其中最核心的方向之一。
达摩院涵盖机器智能、数据计算、机器人、金融科技、X实验室五大领域,汇聚了全球顶尖的科学家团队,目标是实现前沿技术的原创突破与产业落地。这是国内互联网企业最大规模的基础科研投入之一,标志着中国科技公司开始从应用创新向基础研究延伸,也为后续通义千问等大模型产品积累了深厚的技术储备。

技术动态

1. 自注意力机制重构NLP技术体系

Transformer的出现,为自然语言处理领域带来了全新的技术范式:

  • 并行计算能力:自注意力机制可以同时处理整个序列的所有token,训练效率相比RNN提升了数倍甚至数十倍,让更大规模、更多数据的模型训练成为可能;
  • 长距离依赖捕捉:自注意力机制可以直接计算序列中任意两个位置的关联程度,彻底解决了RNN长序列梯度消失的问题,长文本理解能力实现质的飞跃;
  • 统一架构通用性:Transformer不仅适用于文本,还能轻松扩展到图像、语音、视频等模态,为后续多模态大模型的出现埋下了伏笔。
    论文发表后,学界迅速跟进,BERT、GPT等预训练模型的研发工作陆续启动,NLP领域的“预训练时代”已经呼之欲出。

2. 生成对抗网络持续升温

2017年是GAN技术的爆发之年,各类创新变体层出不穷:

  • ProGAN提出渐进式生成思路,首次生成了1024×1024分辨率的高清人脸图像,细节逼真度大幅提升;
  • CycleGAN实现了无配对数据的图像风格迁移,让“照片变油画”“白天变黑夜”等创意应用成为可能;
  • 业界开始探索GAN在更多场景的应用,包括图像修复、超分辨率、药物分子生成等,生成式AI的应用边界持续拓展。
    但此时的生成式AI仍以图像为主,文本生成还没有进入大众视野,更没有人想到未来会出现能写代码、写论文的通用语言模型。

3. 预训练语言模型的早期探索

在Transformer出现之前,预训练的思路已经在NLP领域萌芽。ELMo模型在2018年初正式提出,但其核心技术在2017年已经基本成型。
ELMo采用双向LSTM架构,通过大规模语料预训练得到动态词向量,能够根据上下文区分多义词,在多项NLP任务上刷新了纪录。它证明了“大规模语料预训练+下游任务微调”的范式的有效性,为后续GPT和BERT的登场做好了铺垫。

4. 自动驾驶与机器人领域快速发展

AI开始从数字世界走向物理世界:

  • 自动驾驶赛道迎来融资热潮,特斯拉Autopilot持续迭代,Waymo开始在公共道路测试无人出租车,国内的小鹏、蔚来、百度阿波罗也纷纷布局;
  • 机器人领域,波士顿动力的Atlas人形机器人展示了惊人的运动能力,足式机器人、协作机器人开始走进工厂;
  • 强化学习在机器人控制中的应用越来越广泛,让机器人能够自主学习复杂的运动技能与操作技能。

5. 国内AI生态逐步完善

2017年,国内AI产业从单点技术突破走向生态化发展:

  • 百度正式开源深度学习框架PaddlePaddle(飞桨),成为国内首个自主研发的开源深度学习平台,填补了国产基础框架的空白;
  • 智谱AI的核心技术团队在清华大学开始GLM系列模型的早期技术积累,聚焦预训练语言模型方向,走上了国产通用大模型的自研之路;
  • 各大高校纷纷开设人工智能专业,开始批量培养AI人才,为后续的产业爆发储备人力资源。

年度总结

2017年是AI技术史上至关重要的“原点之年”。
Transformer架构的诞生,为大模型时代推开了大门;AlphaGo Zero证明了AI自主进化的可能性;PyTorch的普及让创新速度再上一个台阶。这一年的大多数事件在当时并没有引发全民热议,但每一项技术突破都在为五年后的那场大爆发积蓄力量。
站在今天回望,2017年更像是一颗种子被埋下的时刻。当时很少有人能预判到,一个原本为机器翻译设计的架构,会在短短几年内演变成能够写代码、做推理、搞创作的通用智能,甚至开始重塑整个社会的生产方式。


2018:预训练范式确立,BERT与GPT双雄格局初现

里程碑事件

2018年6月11日,OpenAI发布GPT-1,生成式预训练路线启航

OpenAI发布初代GPT模型(Generative Pre-trained Transformer),全称GPT-1,参数规模1.17亿,基于Transformer解码器架构,在BookCorpus数据集上进行无监督预训练。
GPT-1首次验证了“生成式预训练+下游任务微调”范式的有效性:先在海量文本上进行无监督的语言模型预训练,再针对具体下游任务进行少量微调,就能在多项NLP任务上取得优异成绩。
虽然1.17亿参数在今天看来微不足道,GPT-1的性能也没有形成碾压优势,但它确立了OpenAI的技术路线——沿着生成式方向,不断放大模型规模与数据规模。这条路线在当时并非行业主流,却在后续几年爆发出了惊人的能量。

2018年10月25日,谷歌发布BERT,双向预训练刷新纪录

谷歌AI团队发布BERT(Bidirectional Encoder Representations from Transformers)模型,基于Transformer编码器架构,采用双向掩码语言模型预训练目标。
BERT在11项经典NLP基准任务上全部刷新了最优成绩,包括问答、文本分类、命名实体识别、自然语言推理等,提升幅度远超之前所有模型。它证明了双向预训练能够更好地理解文本语义,在理解类任务上具备天然优势。
论文发布后,整个NLP领域为之震动。几乎一夜之间,所有NLP任务都开始用BERT做基座,“预训练+微调”正式成为自然语言处理的标准范式。工业界纷纷基于BERT构建业务模型,NLP技术的落地速度大幅加快。

2018年10月,Hugging Face发布Transformers库

创业公司Hugging Face推出开源Transformers库,将GPT、BERT等主流预训练模型封装成统一的API接口,开发者只需要几行代码就能调用最先进的预训练模型。
在此之前,复现顶尖的预训练模型需要大量工程工作,中小团队很难跟上前沿进展。Transformers库彻底降低了预训练模型的使用门槛,让普通开发者也能快速用上最先进的NLP能力。
后续几年,Hugging Face逐步成长为全球最大的AI模型开源社区,汇聚了数十万开源模型与数据集,成为大模型时代最重要的基础设施之一。

2018年8月,OpenAI Five击败Dota 2职业战队

OpenAI开发的AI战队OpenAI Five,在Dota 2 5v5对战中击败了职业战队OG。Dota 2是一款高度复杂的多人策略游戏,存在不完全信息、实时决策、团队协作等多重挑战,其决策复杂度远高于围棋。
这场胜利证明了强化学习在复杂多智能体场景中的潜力,也展示了大模型+强化学习组合的强大通用能力。更重要的是,OpenAI Five使用的是通用的强化学习算法,没有针对游戏做大量手工规则设计,进一步验证了通用AI路线的可行性。

技术动态

1. 预训练范式成为NLP行业标准

GPT与BERT的相继问世,彻底终结了NLP领域“各自为战”的时代:

  • 技术路线分化:形成了以GPT为代表的“解码器生成式路线”和以BERT为代表的“编码器理解式路线”两大方向。当时业界普遍认为BERT路线更适合理解类任务,商业价值更高;GPT的生成式路线更小众,前景并不明朗。
  • 能力跃迁显著:预训练模型让NLP任务的性能普遍提升了10%-30%,很多之前无法商用的场景(如开放域问答、复杂语义理解)第一次具备了落地可能。
  • 研发模式转变:从“从零训练任务模型”转向“基于通用基座微调”,研发效率大幅提升,一个新任务的落地周期从几个月缩短到了几周甚至几天。

2. 预训练模型优化方向百花齐放

BERT和GPT之后,学界围绕预训练模型提出了大量优化方案,出现了“百模大战”的早期雏形:

  • 架构优化:XLNet、RoBERTa、ALBERT、T5等模型相继提出,从预训练目标、训练数据规模、模型结构设计等角度持续优化,不断刷新基准榜单;
  • 轻量化方向:为了让模型能在端侧部署,DistilBERT、TinyBERT等轻量化模型相继出现,通过知识蒸馏在尽量保留精度的前提下大幅压缩模型体积;
  • 中文预训练:百度ERNIE、哈工大LTP、智谱GLM等国产预训练模型陆续推出,针对中文语言特性优化,在中文任务上表现超越了原版英文模型。

3. 多模态预训练开始起步

文本预训练取得突破的同时,研究者开始探索跨模态的预训练方案:

  • 视觉问答、图文检索等多模态任务快速发展,早期的多模态模型采用“文本编码器+图像编码器+融合模块”的架构,初步实现了图文语义的对齐;
  • 视频理解、语音-文本跨模态等方向也开始引入预训练范式,多模态通用模型的研发思路逐步清晰;
  • 但此时的多模态模型仍以“理解”为主,生成能力较弱,距离文生图、文生视频等应用还有较远的距离。

4. AutoML与模型压缩技术持续进步

为了解决大模型落地难的问题,自动化机器学习与模型压缩技术快速发展:

  • AutoML技术能够自动搜索最优的网络结构与超参数,减少人工调参的工作量,让非专业人员也能搭建高性能模型;
  • 模型量化、剪枝、蒸馏等压缩技术逐步成熟,让大模型能够部署在手机、边缘设备等算力有限的平台上;
  • 这些技术为后续大模型的端侧部署、低成本推理积累了重要的工程经验。

5. 国内大模型研发进入加速期

2018年,国内厂商全面跟进预训练技术路线:

  • 百度发布ERNIE预训练模型,引入知识增强与语义掩码策略,在中文NLP任务上表现超越原版BERT,成为国内工业界应用最广泛的预训练基座之一;
  • 清华大学与智谱AI团队持续推进GLM系列模型研发,探索通用语言模型的技术路线,积累了深厚的预训练工程经验;
  • 阿里、腾讯、字节跳动等大厂纷纷组建大模型团队,布局通用预训练语言模型研发,国产大模型的技术储备越来越扎实。

年度总结

2018年是预训练语言模型的“确立之年”。
GPT与BERT一北一南,分别走出了生成式与理解式两条技术路线;Hugging Face的出现让预训练模型快速普及到全行业。这一年,NLP领域彻底告别了小作坊式的任务定制,进入了“大基座+小微调”的工业化时代。
当时绝大多数人都更看好BERT代表的理解路线,因为它更贴近当时的商业场景。很少有人能预料到,几年后真正颠覆世界的,恰恰是当时看起来更“不实用”的生成式路线。OpenAI沿着GPT这条路坚定地走了下去,在所有人的目光之外,悄悄酝酿着一场更大的革命。


2019:规模化定律验证,大模型向通用能力持续进化

里程碑事件

2019年2月14日,OpenAI发布GPT-2,生成能力惊艳业界

OpenAI发布GPT-2模型,参数规模提升至15亿,训练数据量扩大到40GB的网页文本。相比GPT-1,GPT-2的文本生成能力有了质的飞跃,能够生成连贯、通顺、符合逻辑的长段落文本,还能完成翻译、问答、摘要等零样本任务。
由于担心模型被滥用来生成虚假信息,OpenAI一度推迟发布完整权重,只发布了小参数版本,这也引发了业界关于“AI安全与开放”的大讨论。
GPT-2最让人震惊的是它的“零样本能力”——不需要针对下游任务微调,只通过自然语言指令,就能完成很多不同类型的任务。这是通用语言能力的早期信号,也让OpenAI更加坚信:持续扩大模型规模,就能持续涌现出新的能力。

2019年7月22日,微软10亿美元投资OpenAI,开启深度合作

微软宣布向OpenAI投资10亿美元,双方达成深度战略合作。OpenAI将独家授权微软使用其模型技术,微软则为OpenAI提供Azure云算力支持与工程化能力。
这笔投资在当时是AI领域最大规模的单笔投资之一,也标志着OpenAI从纯非营利机构转向“有限营利”模式。更重要的是,微软Azure的算力底座,为OpenAI后续训练更大规模的模型提供了坚实的保障。GPT-3、ChatGPT等里程碑产品的背后,都离不开微软算力与工程团队的支撑。
这次合作也奠定了后续“云厂商+大模型公司”的产业格局——大模型公司做技术研发,云厂商提供算力与商业化渠道,双方深度绑定、互利共赢。

2019年10月,谷歌发布T5,统一“文本到文本”范式

谷歌提出T5(Text-to-Text Transfer Transformer)模型,将所有NLP任务都统一成“文本输入-文本输出”的格式,包括翻译、问答、摘要、分类等等。
这种统一范式的好处是:同一个模型、同一套训练目标、同一套解码逻辑,就能适配所有NLP任务,极大简化了模型的训练与部署。T5还开源了完整的训练代码、数据集与模型权重,成为工业界非常受欢迎的基座模型。
T5的思路深刻影响了后续大模型的设计——今天的对话大模型本质上就是文本到文本的范式,所有任务都通过自然语言描述,由模型生成文本结果。

2019年11月,谷歌发布Meena对话模型,开启对话AI探索

谷歌发布多轮对话模型Meena,参数规模26亿,在341GB的对话数据上训练而成。相比当时的通用对话机器人,Meena的对话连贯性、常识性、趣味性都有大幅提升,更接近人类的聊天体验。
虽然Meena没有正式对外开放,但它证明了大语言模型在对话场景的巨大潜力。沿着这条路走下去,就是三年后爆火全球的ChatGPT。

技术动态

1. 缩放定律被验证,大模型路线确立

2019年最重要的认知突破,是大模型缩放定律(Scaling Law)被系统性验证。
OpenAI与DeepMind的研究分别证明:大语言模型的性能,与模型参数量、训练数据量、计算量三个因素呈平滑的幂律关系。也就是说,只要持续投入更多算力、更大参数、更多数据,模型能力就会持续可预测地提升,不存在明显的天花板。
这一发现彻底坚定了头部玩家做大模型的决心。既然投入就能看到回报,那么军备竞赛就不可避免。OpenAI、谷歌、DeepMind等公司纷纷启动更大规模的模型训练计划,向着百亿、千亿参数的目标冲刺。

2. 预训练模型持续向更大规模演进

整个2019年,预训练模型都在沿着“更大、更强”的方向狂奔:

  • 参数规模从亿级快速迈向十亿级、百亿级,GPT-2(15亿)、Megatron-LM(83亿)、T5-XXL(110亿)等大模型相继出现;
  • 训练数据规模从几十GB扩展到几百GB甚至TB级,覆盖网页、书籍、论文、代码等更丰富的数据源;
  • 模型能力从单纯的文本理解,逐步扩展到零样本学习、少样本学习、简单推理、代码生成等更复杂的任务。
    模型越大,能力就越通用——这个规律在当时已经初步显现。

3. 代码大模型的潜力开始显现

随着训练数据中代码占比的提升,大模型开始展现出令人惊喜的代码能力:

  • 研究发现,在代码上训练过的语言模型,不仅能生成代码,连逻辑推理能力都会同步提升;
  • 代码补全、代码生成、bug修复等场景开始出现AI辅助工具的雏形,虽然效果还比较初级,但已经能帮助开发者提升一定效率;
  • OpenAI内部启动了Codex项目,专门针对代码场景优化模型,为后续GitHub Copilot的诞生埋下了伏笔。

4. 多模态与生成式AI稳步推进

生成式AI在2019年继续稳步发展:

  • 图像生成领域,StyleGAN发布,生成的人脸图像真假难辨,AI换脸、AI生成内容开始引发伦理讨论;
  • 多模态预训练持续推进,UNITER、ViLBERT等模型相继提出,图文跨模态理解能力持续提升;
  • 语音合成、视频生成等方向也在持续进步,生成式AI的版图越来越完整。

5. 国内大模型稳步追赶

国内厂商在2019年持续跟进预训练技术:

  • 百度ERNIE迭代到2.0版本,引入多任务学习与持续学习机制,中文理解能力持续提升,在多个公开榜单上领跑;
  • 阿里、腾讯、字节等大厂的大模型团队持续扩容,工程化能力不断增强,开始训练百亿参数级别的预训练模型;
  • 智谱AI等创业公司持续深耕通用预训练技术,逐步形成自己的技术路线与工程体系。
    虽然和海外顶尖水平还有差距,但国产大模型已经完成了技术积累,具备了追赶的基础。

年度总结

2019年是大模型“规模化路线”的确立之年。
缩放定律的验证,让所有头部玩家都看清了方向——堆算力、堆数据、堆参数,就能持续提升模型能力。GPT-2展现出的通用生成能力,让人们第一次看到了通用语言模型的雏形;微软与OpenAI的联手,更是拉开了千亿级算力军备竞赛的序幕。
这一年,行业的共识是:大模型是未来,但距离真正实用还有很远的距离。没有人能想到,仅仅一年之后,GPT-3就会给整个行业带来颠覆性的震撼。


2020:GPT-3横空出世,通用智能的曙光首次显现

里程碑事件

2020年5月28日,OpenAI发布GPT-3,1750亿参数震惊世界

OpenAI正式发布GPT-3模型,参数规模达到惊人的1750亿,是GPT-2的100多倍。训练数据量达到570GB,涵盖网页、书籍、论文、代码等几乎所有类型的文本数据。
GPT-3最震撼的是它的涌现能力:不需要微调,只通过提示词给出几个示例(少样本学习),甚至只给出指令(零样本学习),就能完成上百种不同的任务——写文章、写代码、翻译、问答、做数学题、推理、创意写作等等。
在此之前,AI模型通常只能做好一件事;而GPT-3证明,当模型规模足够大时,一个模型就能胜任几乎所有文本类任务。这是通用人工智能第一次如此真切地出现在人们面前,整个科技界都为之震动。

2020年9月,OpenAI API正式上线,开启大模型商业化

OpenAI推出API服务,将GPT-3的能力以云端接口的形式对外开放,开发者可以通过API调用GPT-3的能力,构建自己的AI应用。
这是全球首个通用大模型商业化服务,它开创了“模型即服务”的全新商业模式。企业不需要自己训练大模型,只需要按调用量付费,就能获得世界顶尖的AI能力。
API上线后迅速吸引了数十万开发者,催生了一大批AI原生应用,包括文案生成、代码辅助、智能客服、内容创作等多个赛道。大模型的商业价值第一次得到验证,也为后续ChatGPT的爆发打下了商业基础。

2020年11月30日,AlphaFold2破解蛋白质折叠难题

DeepMind的AlphaFold2在第14届国际蛋白质结构预测竞赛(CASP)中以绝对优势夺冠,预测的蛋白质结构精度达到了原子级别,与实验测定的结果相差无几。
蛋白质折叠问题被称为“生物学50年来的重大挑战”,直接关系到药物研发、疾病治疗、生命科学研究。AlphaFold2的突破,是AI在科学领域最具里程碑意义的成果之一,它证明了AI不仅能玩游戏、处理文本,还能助力基础科学研究,加速人类对世界的认知。
AI for Science从此成为AI领域的重要分支,人工智能开始成为科学家的核心研究工具。

2020年6月,OpenAI发布Codex代码模型,AI编程时代前夜

OpenAI在GPT-3基础上,针对海量开源代码数据进行微调,推出了专门的代码大模型Codex。
Codex能够根据自然语言描述生成可运行的代码,支持十几种主流编程语言,在HumanEval代码评测基准上取得了当时最好的成绩。它不仅能写简单的函数,还能理解业务逻辑、编写完整的功能模块。
Codex的诞生,直接催生了后续的GitHub Copilot产品,也开启了AI辅助编程的全新时代。更重要的是,研究发现代码训练能显著提升模型的逻辑推理能力——写代码的过程,本质上就是在训练模型的思维能力。

技术动态

1. 大模型涌现能力引发广泛研究

GPT-3的出现,让“涌现能力”成为AI领域最热门的研究课题:

  • 研究者发现,当模型参数规模突破某个阈值后,很多能力会突然“涌现”——之前完全做不好的任务,模型变大后突然就能做好了,而且能力提升是非线性的;
  • 零样本、少样本、思维链等能力相继被发现,大模型从“记忆与生成”开始走向“推理与思考”;
  • 学界开始深入研究大模型的能力边界、局限性与安全风险,大模型对齐、幻觉、偏见等问题受到越来越多的关注。

2. Prompt工程兴起,成为新的开发范式

随着GPT-3等通用大模型的普及,**Prompt Engineering(提示词工程)**应运而生。
开发者不再需要编写复杂的代码、训练专属的模型,只需要设计高质量的提示词,就能引导大模型完成各种任务。如何写好提示词、如何设计指令、如何构建少样本示例,成为开发者的新技能。
Prompt工程的兴起,大幅降低了AI应用的开发门槛——一个非技术背景的人,只要会写文字,就能调用大模型的能力。这也是后续AI应用能够快速普及的重要原因。

3. 开源大模型生态起步

GPT-3虽然强大,但闭源不开放权重,很多研究者无法深入研究。因此,开源大模型的需求越来越强烈:

  • 谷歌开源T5模型的全系列权重,成为开源社区最受欢迎的大基座之一;
  • 国内智谱AI发布GLM系列开源模型,填补了中文开源大模型的空白;
  • Hugging Face生态持续繁荣,模型、数据集、工具链越来越完善,成为开源大模型最重要的聚集地。
    虽然开源模型的能力和闭源顶尖模型还有不小差距,但开放的生态让更多人能够参与到大模型的研究与创新中。

4. 多模态大模型取得重要进展

2020年,多模态技术也迎来了重要突破:

  • 视觉Transformer(ViT)提出,将Transformer架构成功应用到图像领域,在图像分类任务上超越了传统CNN,为后续多模态大模型统一架构奠定了基础;
  • 图文预训练模型持续迭代,跨模态检索、视觉问答等任务精度持续提升;
  • 语音大模型开始起步,端到端的语音识别、语音合成模型效果越来越好。
    Transformer架构正在统一文本、图像、语音等所有模态,通用多模态大模型的轮廓越来越清晰。

5. 国内大模型研发持续加速

面对GPT-3带来的震撼,国内厂商加快了大模型研发的步伐:

  • 百度、阿里、腾讯、字节等大厂纷纷加码大模型投入,启动千亿参数大模型训练计划;
  • 智谱AI、深度求索等创业公司持续深耕技术,在开源模型、推理优化等方向形成特色优势;
  • 国产算力、国产框架生态持续完善,飞桨、昇思等国产深度学习框架功能越来越成熟,为国产大模型提供了底层支撑。
    虽然和GPT-3还有代差,但国内大模型已经进入了快速追赶的通道。

年度总结

2020年是通用大模型的“曙光之年”。
GPT-3让全世界第一次看到了通用人工智能的可能性——一个模型、一套权重,就能解决几乎所有文本类任务。AlphaFold2则证明了AI在科学领域的巨大价值。大模型不再只是学术圈的玩具,而是真正能够创造价值的生产力工具。
但这一年,大模型还只是开发者圈子里的热点,普通大众对它还知之甚少。没有人能想到,两年之后,一个基于GPT的对话产品会火遍全球,开启一个全新的时代。


2021:AI编程时代开启,Anthropic登场重塑产业格局

里程碑事件

2021年2月,Anthropic正式成立,安全对齐路线异军突起

前OpenAI研究副总裁Dario Amodei与妹妹Daniela Amodei联合创立Anthropic公司,核心团队包括多位OpenAI早期核心研究员。公司以“AI安全对齐”为核心理念,目标是构建可靠、可解释、安全可控的通用人工智能。
Anthropic的成立源于团队与OpenAI在发展路线上的分歧——他们更重视AI的安全性与可控性,反对过度商业化。成立之初,Anthropic就获得了大量顶级资本的支持,成为OpenAI最有力的竞争对手。
谁也没有想到,这家成立之初主打“安全”的公司,会在几年后凭借Claude系列模型,在大模型与AI编程赛道实现对OpenAI的反超。

2021年6月29日,GitHub Copilot技术预览发布

GitHub与OpenAI联合发布GitHub Copilot技术预览版,基于OpenAI Codex代码大模型,能够在VS Code等编辑器中实时代码补全。
和传统的代码补全工具不同,Copilot能够理解注释与上下文,生成完整的函数、类甚至整个模块,支持Python、JavaScript、Java等几十种编程语言。开发者只需要写一句注释描述需求,AI就能自动写出对应的代码。
这是AI编程工具第一次真正走向主流开发者,它标志着编程领域的人机协作进入了全新阶段。虽然当时还只是补全级别,但它让所有开发者都直观感受到了AI对编程效率的提升。

2021年1月,OpenAI发布CLIP与DALL-E,多模态生成爆发

OpenAI同期发布了两个重磅多模态模型:CLIP与DALL-E。

  • CLIP:通过大规模图文对预训练,实现了强大的零样本图像分类能力,能够用自然语言描述来识别任意类别的图像,彻底打破了传统图像分类的类别限制。更重要的是,CLIP实现了文本与图像的语义空间对齐,为后续多模态生成、图文理解奠定了核心基础。
  • DALL-E:首个大规模文生图模型,能够根据文字描述生成对应图像,创意性与准确性远超之前所有模型。它证明了大语言模型的生成能力可以成功迁移到图像领域,开启了AI创意生成的新时代。
    这两个模型的发布,标志着多模态大模型从“理解”走向“生成”,AI的能力边界再次被大幅拓宽。

2021年12月,字节跳动正式启动大模型专项研发

字节跳动正式成立大模型团队,启动通用大模型研发项目。凭借海量的文本、图像、视频数据,以及强大的工程与算力基础,字节快速跻身国内大模型第一梯队。
和其他厂商不同,字节的大模型研发从一开始就紧密结合业务场景,在内容创作、推荐系统、智能客服等场景深度落地。这套“技术+业务”双轮驱动的路线,也为后续豆包产品的快速崛起打下了坚实基础。

技术动态

1. 代码大模型产品化落地加速

2021年是AI编程从概念走向产品的关键一年:

  • OpenAI Codex模型持续迭代,代码生成质量、长代码理解能力、多语言支持都大幅提升;
  • GitHub Copilot开启公测后,受到开发者热烈追捧,内测用户的编码效率平均提升了30%以上;
  • 国内厂商纷纷跟进代码大模型研发,智谱、百度、阿里等都推出了自己的代码辅助工具;
  • 业界普遍形成共识:AI将彻底改变编程的方式,但主流观点认为AI只是“辅助工具”,替代人类还遥遥无期。

2. Prompt工程与大模型应用生态繁荣

随着GPT-3 API的普及,大模型应用开发生态进入繁荣期:

  • Prompt工程体系逐步成熟,出现了思维链提示、少样本提示、角色设定等各种技巧,能够有效提升大模型的输出质量;
  • 基于大模型的创业公司大量涌现,覆盖文案生成、营销、教育、法律、医疗等各个行业;
  • 大模型的应用模式从“直接调用”逐步走向“RAG检索增强”“工具调用”等更复杂的方案,应用场景持续深化。

3. AI安全对齐技术快速发展

随着大模型能力越来越强,安全与对齐问题受到越来越多的关注:

  • Anthropic团队深入研究AI对齐技术,提出了一系列提升模型可靠性、降低幻觉、增强可控性的方法;
  • RLHF(人类反馈强化学习)技术逐步成熟,能够有效对齐模型行为与人类偏好,让模型输出更符合人类期望;
  • 模型偏见、虚假信息生成、滥用风险等问题被广泛讨论,行业开始探索大模型的安全治理方案。
    这些技术积累,为后续ChatGPT的惊艳表现埋下了重要伏笔。

4. 开源大模型持续进步

开源社区在2021年持续追赶:

  • EleutherAI等开源组织训练了GPT-Neo、GPT-J等开源大模型,参数规模达到60亿,是当时能力最强的开源生成式模型;
  • 中文开源大模型快速发展,智谱GLM系列、百度ERNIE系列持续迭代,满足了国内开发者的本地化部署需求;
  • 模型压缩、推理优化技术持续进步,让大模型能够在更低成本的硬件上运行。

5. 国内大模型格局逐步清晰

2021年,国内大模型赛道的玩家逐步清晰,形成了大厂+创业公司的多元格局:

  • 大厂阵营:百度文心、阿里通义、腾讯混元、字节豆包四大厂系全面布局,依托自身业务场景快速迭代;
  • 创业公司阵营:智谱AI、月之暗面、深度求索等公司聚焦通用大模型技术,各有技术特色;
  • 产学研结合紧密,高校与企业合作紧密,人才流动频繁,整个行业充满活力。

年度总结

2021年是AI产业生态全面繁荣的一年。
多模态能力突破了文本的边界,AI编程走进了开发者的日常,大模型商业化模式得到验证,Anthropic等新玩家入场带来了更多竞争与创新。整个行业都在快速奔跑,所有人都能感受到:一场更大的变革正在酝酿之中。
GPT-3已经足够震撼,但它的使用门槛还是太高,普通用户很难感受到它的威力。所有人都在等待一个产品,能把大模型的能力用最简单的方式呈现给大众。而这个产品,已经在路上了。


2022:ChatGPT引爆全球,生成式AI时代全面到来

里程碑事件

2022年11月30日,ChatGPT正式发布,开启全民AI时代

OpenAI正式推出ChatGPT对话机器人,基于GPT-3.5系列模型,采用RLHF人类反馈强化学习训练。
上线仅仅5天,注册用户就突破100万;两个月后,月活跃用户突破1亿,成为人类历史上增长最快的消费级应用。
和之前所有的对话机器人都不同,ChatGPT展现出了惊人的对话能力:它能理解复杂的上下文、进行多轮对话、写代码、写文案、做方案、解数学题,甚至能陪你聊天谈心。它的回答流畅自然、逻辑清晰,绝大多数时候你甚至感觉不到自己在和机器对话。
ChatGPT的爆火彻底点燃了全民AI热潮。上到科技巨头CEO,下到普通学生上班族,所有人都在讨论AI。资本疯狂涌入,创业公司批量诞生,各行各业都开始讨论如何用AI降本增效。一个全新的时代,正式拉开了大幕。

2022年8月22日,Stable Diffusion开源,文生图全民普及

德国慕尼黑大学与Stability AI联合开源Stable Diffusion文生图模型,任何人都可以免费下载、本地运行、二次开发。
和DALL-E、Midjourney等闭源服务不同,Stable Diffusion开源了完整权重,对算力要求低,普通消费级显卡就能运行。它的开源直接引爆了全球的AI绘画热潮:开发者快速开发出各种WebUI、插件、模型微调工具,创作者则用它生成各种创意图像。
Stable Diffusion的出现,证明了开源生成式AI的巨大潜力,也让AIGC(人工智能生成内容)成为年度最热的科技概念。文生图、文生视频、AI音频等赛道快速升温,生成式AI从文本扩展到了所有内容形态。

2022年10月,ReAct框架提出,Agent理论体系奠基

谷歌与普林斯顿大学联合提出ReAct(Reasoning + Acting)框架,首次将“推理思考”与“工具调用”结合起来,让大模型能够自主调用外部工具完成复杂任务。
ReAct的核心思路是:让大模型像人一样,先思考下一步该做什么,然后调用工具获取信息,再根据结果继续思考,循环往复直到完成任务。这种“思考-行动-观察”的循环模式,成为后续所有LLM Agent的核心决策范式。
这篇论文为Agent时代奠定了理论基础。在此之前,大模型只能靠自己的内置知识回答问题;有了ReAct之后,大模型可以联网搜索、调用计算器、操作数据库,能力边界被无限拓宽。

2022年12月,Anthropic提出宪法式AI,Claude模型即将成型

Anthropic发表《Constitutional AI》论文,提出了“宪法式AI对齐”方法。不同于RLHF依赖大量人类标注,宪法式AI让模型基于一套“宪法原则”进行自我批判、自我修正,从而实现对齐。
这种方法不仅大幅降低了对齐成本,还让模型的行为更可控、更透明、更符合人类价值观。这套技术也成为Claude系列模型的核心特色——低幻觉、高安全、长上下文、强可控性。
论文发布的同时,Anthropic的初代Claude模型已经基本研发完成,即将在次年正式登场,与GPT展开正面竞争。

2022年10月,LangChain正式发布,LLM应用开发标准化

开发者Harrison Chase发布LangChain开源框架,迅速成为全球最热门的LLM应用开发工具。
LangChain提供了一套标准化的组件与工作流,包括模型调用、提示词管理、文档加载、向量检索、Agent编排等等。开发者不需要从零搭建LLM应用,只需要用LangChain的组件快速拼接,就能构建出RAG、智能客服、Agent等复杂应用。
LangChain的出现大幅降低了LLM应用的开发门槛,推动了大模型在企业级场景的落地。它也成为了大模型应用开发的事实标准,催生了整个LLMOps生态。

技术动态

1. RLHF技术成熟,对话体验实现质变

ChatGPT的成功,很大程度上归功于RLHF技术的成熟应用:

  • RLHF分为三个步骤:监督微调、奖励模型训练、强化学习优化。通过人类反馈,让模型学会“人类喜欢什么样的回答”;
  • 经过RLHF训练后,模型不再只是生硬地输出文本,而是能够理解人类意图、给出有用的回答、保持友好的对话风格;
  • 这一技术彻底解决了“大模型能力强但不好用”的问题,让通用大模型真正走进了普通用户的生活。

2. RAG技术从探索走向实用

随着大模型应用的深入,幻觉问题与知识更新问题越来越突出,**RAG(检索增强生成)**技术应运而生:

  • RAG的核心思路是:用户提问时,先从外部知识库中检索相关文档,再把文档内容和问题一起传给大模型,让大模型基于检索到的信息生成答案;
  • 它能够有效降低大模型幻觉,同时让大模型能够接入私有数据、实时数据,大幅拓展了应用场景;
  • 2022年底到2023年初,RAG快速成为企业级大模型应用的标准方案,向量数据库、文档解析、检索算法等配套技术也迎来爆发。

3. 开源生成式生态全面爆发

Stable Diffusion的开源,带动了整个生成式AI开源生态的繁荣:

  • 图像生成领域,ControlNet、LoRA微调、DreamBooth等技术相继出现,让AI绘画的可控性、定制化能力大幅提升,设计师、插画师纷纷开始使用AI工具;
  • 文本生成领域,LLaMA系列即将发布,开源大模型即将迎来新一轮爆发;
  • 整个开源社区展现出惊人的创新活力,各种新玩法、新工具、新模型层出不穷,创新速度甚至超过了闭源大厂。

4. 国内大模型进入冲刺阶段

ChatGPT的爆火给国内行业带来了巨大的震撼,也按下了国产大模型的加速键:

  • 所有头部厂商都加快了研发节奏,目标是尽快推出对标ChatGPT的对话式产品;
  • 百度、阿里、智谱等技术积累深厚的厂商,已经进入了产品化的最后阶段,准备在次年春季集中发布;
  • 资本疯狂涌入大模型赛道,创业公司估值水涨船高,人才争夺空前激烈,“百模大战”已经箭在弦上。

年度总结

2022年是生成式AI的“元年”。
ChatGPT让全民认识了大语言模型,Stable Diffusion让所有人都能用上AI绘画,ReAct与LangChain为后续的Agent时代铺好了路。这一年之前,AI还是小众的前沿技术;这一年之后,AI成了所有人都在谈论、都在使用的通用工具。
没有人怀疑AI将改变世界,但改变的速度远远超出了所有人的预期。一场席卷全球的百模大战,即将在新的一年全面打响。


2023:百模大战全面开打,多模态与工具生态爆发

里程碑事件

2023年3月14日,GPT-4发布,多模态能力实现阶跃

OpenAI正式发布GPT-4大模型,支持文本+图像多模态输入,逻辑推理、代码能力、长文本理解能力相比GPT-3.5实现了阶跃式提升。
GPT-4在律师资格考试、医学执照考试、编程竞赛等专业考试中达到了人类顶尖水平,甚至能通过模拟的律师资格考试并排名前10%。它的推理深度、问题解决能力、指令遵循能力都有了质的飞跃,能够处理更复杂的任务。
同日,GPT-4插件功能正式发布,支持大模型调用第三方工具,包括联网搜索、代码解释器、各类第三方服务。这是大模型从“知识系统”向“操作系统”进化的关键一步,Agent能力的雏形已经显现。

2023年3月14日,Anthropic发布初代Claude,双雄格局形成

就在GPT-4发布的同一天,Anthropic正式推出初代Claude大模型,主打长上下文、低幻觉、高安全合规。
初代Claude就支持100K tokens的上下文窗口,相当于能一次性读完一整本书,远超同期GPT-4的8K窗口。在企业级场景,Claude凭借出色的长文档处理能力、稳定的输出质量与严格的安全标准,快速抢占了大量市场份额。
从此,大模型市场从OpenAI一家独大,进入了OpenAI与Anthropic双雄争霸的格局。两家公司你追我赶,轮番发布新品,推动着大模型能力快速迭代。

2023年4月7日,通义千问开启邀测,国产大模型集中登场

阿里云正式发布通义千问大模型并开启邀请测试,成为国内头部互联网厂商中首个正式推出的通用对话大模型。
随后几个月里,国产大模型迎来了发布潮:

  • 6月,字节跳动推出豆包APP,凭借流畅的中文体验、轻量化的产品设计快速起量,迅速成为C端最受欢迎的国产AI助手之一;
  • 8月31日,智谱AI发布智谱清言,基于ChatGLM系列模型,走开源+商用双路线,技术积累深厚;
  • 同期,月之暗面的Kimi、百度文心一言、讯飞星火等密集发布,各有特色。
    国内正式进入“百模大战”时代,从大厂到创业公司,数十家厂商同台竞技,国产大模型能力快速追赶国际水平。

2023年7月11日,Claude 2发布,200K上下文领跑行业

Anthropic发布Claude 2大模型,将上下文窗口提升到200K tokens,能够一次性处理约15万字的文本内容,相当于一整本长篇小说。
长上下文能力让Claude特别适合处理长文档、代码仓库、法律合同、学术论文等场景。用户可以直接把整个PDF、整个代码库丢给模型,不需要拆分就能直接分析、总结、改写。
长上下文成为Claude的核心差异化优势,也拉开了大模型行业的“上下文军备竞赛”。后续各家厂商纷纷扩大上下文窗口,从32K到128K,再到1M,窗口长度成为旗舰模型的核心指标之一。

2023年11月6日,OpenAI DevDay发布GPTs,Agent生态启航

OpenAI举办首届开发者大会DevDay,发布了一系列重磅产品:

  • GPTs:用户不需要写代码,只通过自然语言描述,就能定制专属的GPT机器人,可以接入自定义数据、调用工具;
  • Assistants API:为开发者提供官方的Agent开发接口,支持代码解释器、检索、函数调用等能力;
  • GPT-4 Turbo:上下文提升到128K,价格大幅降低,能力持续升级。
    这次大会标志着大模型平台化的开始——OpenAI不只是做模型,而是要做AI时代的操作系统,让所有开发者都能在上面构建应用。Agent生态从概念走向了产品化,每个人都能构建自己的智能体。

2023年11月4日,xAI发布Grok,马斯克入局大模型

马斯克旗下的xAI公司发布首款大模型Grok,主打实时联网信息、诙谐的回答风格,并且将逐步开源。
Grok依托X平台(原Twitter)的实时数据,能够获取最新的资讯信息,回答风格更加个性、大胆。虽然综合能力和GPT-4、Claude还有差距,但它的入局进一步丰富了大模型市场的竞争格局,也推动了开源大模型的发展。

技术动态

1. 多模态技术全面成熟

2023年是多模态大模型全面成熟的一年:

  • 旗舰模型普遍支持图文多模态输入,能够理解图片、图表、截图、手绘稿等内容,应用场景大幅拓宽;
  • 文生图技术持续迭代,Midjourney V5、Stable Diffusion XL等模型生成质量大幅提升,细节逼真度已经接近真实照片;
  • 文生视频开始起步,Runway、Pika等产品推出,能够生成几秒到几十秒的短视频,视频生成时代的大门缓缓开启。
    大模型正在从“纯文本”走向“多模态”,能够处理的信息类型越来越丰富。

2. 工具调用成为大模型标配

2023年,函数调用(Function Calling)能力成为旗舰大模型的标配:

  • 大模型能够自主判断何时需要调用工具,自动生成调用参数,根据返回结果继续处理任务;
  • 工具调用让大模型突破了自身知识的限制,可以联网搜索、调用计算器、操作数据库、控制第三方软件;
  • 这是Agent能力的核心基础——只有能调用工具,大模型才能真正落地到真实的工作流中,解决实际问题。

3. AI编程工具快速迭代

AI编程赛道在2023年迎来爆发:

  • Cursor IDE崭露头角,作为原生AI编辑器,它深度集成了大模型能力,支持全代码库理解、AI聊天、代码重构、bug修复等功能,迅速成为开发者的新宠;
  • GitHub Copilot持续迭代,推出Copilot Chat功能,从“行级补全”升级为“对话式编程”;
  • Windsurf(原Codeium)等产品也快速跟进,AI编程工具市场竞争日趋激烈;
  • 但此时的AI编程工具还主要是“对话+补全”模式,需要开发者一步步引导,还不具备自主完成复杂项目的能力。

4. RAG技术广泛落地,向量数据库爆发

RAG技术在2023年成为企业级大模型应用的标准方案:

  • 从创业公司到大型企业,都在基于RAG搭建私有知识库、智能客服、内部问答系统等应用;
  • 向量数据库赛道迎来爆发,Pinecone、Weaviate、Milvus等产品快速发展,成为大模型时代的核心基础设施;
  • RAG技术本身也在快速进化,从简单的向量检索,发展出多轮检索、重排序、混合检索、文档分块优化等各种优化方案,效果持续提升。

5. 应用开发平台兴起

随着大模型应用的普及,低代码/无代码的AI应用开发平台开始兴起:

  • Dify正式成立,首创LLMOps概念,推出开源的AI应用开发平台,支持可视化编排、Prompt管理、RAG、Agent等功能,让非技术人员也能搭建AI应用;
  • 国内厂商纷纷推出类似的应用开发平台,降低大模型应用的落地门槛;
  • 整个大模型产业分层逐步清晰:底层模型厂商、中间件与工具厂商、上层应用厂商,产业链越来越成熟。

年度总结

2023年是大模型产业“百花齐放”的一年。
海外双雄争霸,国内百模大战,多模态、工具调用、RAG、Agent等技术快速落地,AI编程、AI创作、企业级应用等场景全面开花。这一年,所有人都在拥抱AI,各行各业都在探索AI的落地方式。
但冷静下来看,这一年的大模型更多还是“辅助工具”的角色——它能帮你写文案、改代码、做总结,但复杂的任务还是需要人来主导。下一个阶段的进化方向已经清晰:让AI从“辅助者”变成“执行者”,真正自主完成复杂的工作流。


2024:长上下文军备竞赛,本地化与标准化并行推进

里程碑事件

2024年3月4日,Claude 3系列发布,综合能力首次超越GPT

Anthropic发布Claude 3系列大模型,包含Opus、Sonnet、Haiku三个档位,分别对应旗舰、均衡、轻量三个场景。
旗舰版Claude 3 Opus在综合基准测试上首次全面超越GPT-4,尤其是在长上下文、代码生成、逻辑推理、指令遵循等方面优势明显。全系列支持多模态图像理解,上下文窗口最高支持200K,后续逐步扩展到1M tokens。
Claude 3系列的发布,标志着大模型市场正式进入“两强并立”的时代。Anthropic不再只是追赶者,而是成为了技术领跑者之一。尤其是在企业级与开发者市场,Claude凭借出色的工程能力与长上下文优势,市场份额持续提升。

2024年5月13日,GPT-4o发布,实时多模态交互来临

OpenAI发布GPT-4o(omni)模型,主打“全模态、实时交互”。它支持文本、图像、音频、视频输入,能够实现实时语音对话,响应延迟和人类对话相当。
GPT-4o的多模态能力达到了新的高度:它能看懂屏幕截图、分析图表、识别手写公式,甚至能通过摄像头实时分析画面。实时语音对话体验流畅自然,支持情绪理解、多语言实时翻译。
这款模型也标志着大模型正式进入“全模态实时交互”时代,AI不再只是打字聊天,而是能够像真人一样听、说、看,进行自然的多模态交流。

2024年11月,Anthropic提出MCP协议,工具生态开始标准化

Anthropic正式提出MCP(Model Context Protocol,模型上下文协议),一套开放的通用协议,用于连接大模型与外部工具、数据源、服务。
在MCP出现之前,每个Agent工具都有自己的一套接口标准,工具适配成本很高。MCP提供了统一的协议规范,只要符合MCP标准的工具,就能被所有支持MCP的大模型与Agent直接调用,无需单独适配。
MCP的提出具有里程碑意义,它相当于AI时代的“USB接口”,能够让工具生态快速繁荣。后续OpenAI、谷歌、各大开源项目纷纷宣布支持MCP,它逐步成为Agent工具的事实标准。

2024年5月15日,字节跳动发布豆包大模型,掀起行业价格战

字节跳动正式对外发布豆包大模型,同时公布了极具冲击力的定价——输入价格低至0.0008元/千tokens,输出0.002元/千tokens,价格仅为当时主流模型的十分之一。
豆包大模型的发布直接掀起了大模型行业的价格战,各家厂商纷纷降价,大模型的调用成本在短短几个月内下降了90%以上。价格的骤降,让大模型的大规模商用成为可能,之前因为成本太高无法落地的场景,现在都变得经济可行。
凭借C端产品的海量数据与工程优化能力,豆包大模型在性价比、中文能力、响应速度上都具备很强的竞争力,快速跻身国内大模型第一梯队。

2024年5月30日,腾讯发布元宝APP,大厂悉数完成C端布局

腾讯正式发布“元宝”AI助手APP,搭载腾讯混元大模型,全面接入微信、QQ等腾讯生态。至此,百度、阿里、字节、腾讯四大互联网巨头全部完成了通用大模型的C端产品布局。
国产大模型已经从“有没有”进入了“好不好”的竞争阶段。各家厂商在能力上的差距逐步缩小,差异化更多体现在生态、场景、产品体验上。大模型不再是炫技的黑科技,而是真正融入了普通人的日常生活。

2024年12月26日,DeepSeek V3发布,国产模型强势崛起

深度求索推出DeepSeek V3大模型并开源,综合能力达到国际一线水平,尤其是代码能力、长上下文能力表现突出。
随后在2025年1月,DeepSeek又发布了具备强推理能力的DeepSeek R1模型,纯强化学习训练的推理模型比肩国际顶尖水平,在春节期间彻底引爆国内AI圈。
DeepSeek的逆袭,证明了国产大模型已经具备了和国际顶尖厂商同台竞技的实力。中国AI产业从“跟跑”正式进入“并跑”阶段,部分领域甚至开始领跑。

技术动态

1. 长上下文军备竞赛白热化

2024年,上下文窗口长度成为旗舰模型的核心竞争点:

  • 从年初的128K,到年中的200K,再到年底的1M tokens,上下文窗口在一年内翻了好几倍;
  • 1M tokens相当于约75万字,能够一次性载入一整本厚书、一个中型代码仓库、上百份合同文档;
  • 长上下文技术彻底改变了大模型的使用方式——不再需要拆分文档、摘要总结,直接把全部内容丢给模型就能处理。代码、法律、学术、政务等长文档场景的体验实现了质的飞跃。

2. 本地大模型部署门槛骤降

Ollama的普及,让本地大模型部署的门槛降到了历史最低:

  • 只需要一行命令,就能下载并运行各种开源大模型,支持Windows、Mac、Linux全平台;
  • 普通消费级显卡就能运行7B、14B参数的模型,Apple Silicon芯片的Mac甚至能流畅运行70B模型;
  • 围绕Ollama形成了完整的开源生态,包括各种前端界面、插件、应用,私有化部署变得前所未有的简单。
    本地化部署的普及,让数据敏感型企业、个人开发者都能低成本用上大模型,也推动了开源大模型生态的持续繁荣。

3. 多模型客户端生态繁荣

随着大模型厂商越来越多,用户需要同时使用多家模型,多模型聚合客户端应运而生:

  • Chatbox:开源的跨平台AI客户端,支持接入OpenAI、Anthropic、DeepSeek、豆包等几乎所有主流模型,界面简洁,功能实用,拥有大量用户;
  • Cherry Studio:后起之秀,支持更多模型、更丰富的功能,包括会话管理、提示词库、MCP工具支持等,体验持续优化;
  • 这类客户端解决了“多模型切换麻烦”的痛点,让用户可以在一个界面里使用所有模型,根据不同场景选择最合适的模型。它们也成为很多AI用户的桌面标配。

4. Agent技术从概念走向落地

Agent技术在2024年持续进化,逐步从Demo走向实用:

  • 多步规划、自我反思、工具调用等技术持续成熟,Agent完成复杂任务的成功率稳步提升;
  • 编程Agent、办公Agent、数据分析Agent等垂直场景的Agent产品陆续出现,开始在真实工作流中发挥作用;
  • 但整体来看,这一年的Agent还不够稳定,容易跑偏、容易出错,还需要人工监督与修正,距离真正的自主工作还有差距。

5. AI编程工具持续进化

AI编程工具在2024年进入了新的阶段:

  • Windsurf正式版发布,主打“全仓库理解+Agent编程”,能够基于整个代码库进行开发,支持多步代码修改,是首个真正主打Agent编程的IDE产品;
  • Cursor持续迭代,推出了更多深度集成的AI功能,用户量快速增长,成为最受欢迎的AI编辑器;
  • 传统IDE厂商纷纷跟进,VS Code、JetBrains系列都内置了AI助手功能,AI编程从“可选插件”变成了“标配能力”。
    整个行业都在期待下一个范式级的产品——一个能真正自主完成项目的代码Agent。

年度总结

2024年是大模型“务实落地”的一年。
这一年没有像ChatGPT那样现象级的爆点,但技术在稳步进化:上下文越来越长、价格越来越低、多模态越来越强、本地化越来越容易。大模型从“新鲜事物”变成了日常工具,融入了工作与生活的方方面面。
更重要的是,MCP协议的提出、Agent技术的成熟、编程工具的进化,都在为下一轮变革积蓄力量。所有人都隐约感觉到:AI编程的下一个时代,即将到来。


2025:Agent编程落地元年,人机协作范式彻底重构

里程碑事件

2025年2月2日,Karpathy提出“Vibe Coding”,重新定义编程范式

OpenAI联合创始人Andrej Karpathy在X平台发布帖子,首次提出**“Vibe Coding”**概念。
他提出,未来的编程不再是开发者逐行写代码,而是用自然语言向AI描述意图和感觉(Vibe),由AI来完成具体的代码实现。开发者的角色从“编码者”转变为“产品经理+架构师”,负责定义需求、把控方向、验收结果。
这个概念引发了全球开发者的大讨论。有人觉得这是编程的未来,有人觉得这是对开发者职业的威胁。但无论如何,所有人都意识到:编程的范式,正在发生根本性的变化。

2025年2月24日,Claude Code发布,代码Agent正式产品化

Anthropic推出Claude 3.7 Sonnet模型,同步发布了Claude Code代码Agent工具——一个运行在终端里的AI编程助手。
和传统的AI编辑器不同,Claude Code是一个真正的Agent:它能直接读写本地文件、执行shell命令、运行测试、安装依赖,遇到报错能自己排查、自己修正。开发者只需要用自然语言描述需求,它就能自主拆解步骤,一步步完成整个开发任务。
Claude Code的发布标志着AI编程从“辅助补全”正式进入“Agent执行”时代。它不再只是给你建议,而是真的能上手干活。很多开发者试用后惊呼:这才是真正的AI编程。

2025年4月17日,OpenAI发布Codex CLI,双雄格局延续

OpenAI推出开源本地工具Codex CLI,将GPT模型的代码能力封装为命令行Agent,支持直接操作本地文件与终端。
和Claude Code类似,Codex CLI也能自主完成多步编程任务,并且完全开源、支持本地部署,吸引了大量开发者与企业用户。
Claude Code与Codex CLI两大产品,正式确立了命令行代码Agent的双雄格局。AI编程工具赛道从“IDE插件”时代,进入了“原生Agent”时代。

2025年5月,Claude Code全面开放,安装门槛持续降低

Claude Code正式向所有公众开放注册,同时持续优化产品形态,逐步脱离了对Node.js环境的依赖,推出了独立的桌面应用与安装包。
安装门槛的降低,让更多普通开发者能够快速上手Claude Code。凭借出色的代码工程能力、稳定的多步执行表现,Claude Code迅速成为工程化AI编程的标杆产品,被大量团队引入日常开发工作流。
大量开发者反馈,使用Claude Code后,开发效率提升了2-5倍,很多繁琐的重复工作都可以交给Agent完成,开发者可以更专注于架构设计与需求拆解。

2025年下半年,Claude 4系列发布,Thinking模式重塑推理能力

Anthropic陆续发布Claude 4系列模型,推出Thinking(深度思考)模式
开启Thinking模式后,模型会先进行内部的深度思考,一步步拆解问题、推理逻辑、验证方案,再给出最终答案。就像人解题时打草稿一样,思考过程越长,答案的准确性就越高。
Thinking模式让大模型的复杂推理能力、代码能力、数学能力都实现了大幅跃升。尤其是在复杂工程任务、深度逻辑推理场景,思考模式的优势非常明显。
随后,OpenAI、DeepSeek等厂商也纷纷跟进推出推理模式,“深度思考”成为旗舰大模型的标配功能。

2025年9月,字节跳动推出Coze(扣子),零代码搭建智能体

字节跳动正式推出**Coze(扣子)**零代码AI应用开发平台,主打“5分钟搭建一个智能体”。
用户不需要写代码,通过可视化配置,就能接入知识库、配置插件、设计工作流,快速搭建专属的AI Agent,并且可以一键发布到豆包、微信、飞书等多个平台。
Coze的出现大幅降低了Agent的开发门槛,个人开发者、中小团队甚至非技术人员,都能快速搭建自己的智能体。它也推动了Agent从技术圈走向更广泛的应用场景。

技术动态

1. Skills与Hooks机制落地,Agent可定制化

随着Claude Code等Agent工具的成熟,**Skills(技能包)Hooks(钩子系统)**机制相继落地:

  • Skills:可以给Agent安装额外的技能包,比如React开发技能、数据库运维技能、文档写作技能等。每个技能包包含专属的提示词、工具、最佳实践,让Agent在特定领域更专业;
  • Hooks:钩子系统允许开发者在Agent执行的各个节点插入自定义逻辑,比如执行命令前做安全检查、生成代码后自动格式化、任务完成后自动提交代码等;
  • 这两套机制让Agent从“通用工具”变成了“可定制的工作台”,每个团队都可以根据自己的技术栈与工作流,打造专属的AI Agent。

2. MCP协议生态快速扩张

MCP协议提出后,获得了全行业的广泛支持:

  • 主流大模型厂商、Agent工具纷纷宣布支持MCP协议;
  • 社区贡献了大量MCP工具,涵盖数据库、浏览器、文件系统、邮件、办公软件、云服务等几乎所有场景;
  • MCP生态的繁荣,让Agent的能力边界被无限拓宽。一个Agent只要接入MCP,就能调用成千上万种工具,完成各种各样的任务。
    Agent + MCP的组合,正在成为AI时代的标准工作模式。

3. 国产推理模型追平国际水平

2025年初,DeepSeek R1的爆火彻底点燃了国产推理模型的赛道:

  • 智谱、阿里、字节、百度等厂商快速跟进,纷纷推出自己的推理模型,能力快速提升;
  • 国产模型在代码、数学、推理等核心能力上,已经和国际顶尖模型非常接近,部分场景甚至反超;
  • 更重要的是,国产模型价格更低、本地化部署更方便、数据安全更有保障,在国内企业级市场优势明显。
    中国大模型产业已经真正进入了全球第一梯队。

4. Agent应用向全场景延伸

Agent技术不再局限于编程领域,开始向各行各业渗透,成为数字化工作流的新引擎:

  • 办公Agent:能够自主处理邮件、整理文档、协调日程、生成报表、对接跨部门流程,承担了大量行政与事务性工作;
  • 运营Agent:可以自主完成内容创作、多平台发布、用户评论回复、数据复盘,甚至能根据投放效果自主调整策略;
  • 客服Agent:从传统问答升级为全流程自主处理,能够查询订单、修改信息、办理业务、解决售后,复杂问题才转接人工;
  • 数据分析Agent:能够自主理解数据需求、写SQL、做数据清洗、生成可视化图表、输出完整分析报告,全程只需要一句自然语言指令。

这一阶段的Agent虽然还离不开人工审核与兜底,但已经能独立承担60%以上的重复性工作。行业共识逐渐形成:Agent不会立刻取代岗位,但会彻底改变每个岗位的工作方式。

5. 开源Agent生态蓬勃发展

闭源产品领跑的同时,开源社区也爆发出惊人的创新活力:

  • 全球开发者基于Claude Code与Codex CLI的设计思路,开发了大量开源代码Agent项目,支持多模型切换、私有化部署、定制化工作流,满足了不同团队的差异化需求;
  • ChatboxCherry Studio等多模型客户端全面升级Agent能力,陆续原生支持工具调用、多步执行、MCP协议接入,从单纯的“聊天窗口”进化为通用Agent工作台;
  • 开源社区与闭源产品形成双向促进的良性循环:很多新玩法、新工具先在社区诞生,再被商业产品吸收;商业产品验证成功的模式,也会快速出现开源实现。

6. Agent工程化体系逐步成型

随着企业级落地需求增加,Agent不再只是Demo玩具,工程化与安全管控体系快速完善:

  • 安全管控:命令白名单、文件权限隔离、人工确认节点、操作审计回溯等机制逐步成熟,解决了企业最关心的数据安全与操作风险问题;
  • LLMOps升级:Dify等应用开发平台全面支持Agent可视化编排,企业可以快速搭建、部署、监控、迭代自己的专属Agent;
  • 行业开始沉淀Agent开发的最佳实践,包括提示词架构设计、工具粒度原则、失败兜底机制、效果评估体系等,Agent开发从“手工作坊”逐步走向“工业化”。

年度总结

2025年是名副其实的Agent编程落地元年
从年初Karpathy提出“Vibe Coding”引发行业讨论,到年中Claude Code与Codex CLI双雄并立,再到年末Thinking模式带来的能力跃升,整个行业完成了从“AI辅助补全”到“Agent自主执行”的范式跃迁。开发者的核心价值,从逐行编写代码,转向了需求拆解、架构设计、质量把控与Agent驾驭。

这一年也是国产大模型的逆袭之年。DeepSeek R1引爆市场,智谱、通义、豆包、Kimi全面跟进推理能力,中国AI产业从“跟跑”正式迈入“并跑”阶段,在性价比、本地化、中文场景等方面甚至形成了自己的优势。

十年前,AI还只能识别图像、听懂语音;十年后的今天,它已经能坐在终端前,自主完成一整个开发任务。而这场变革,还远没有到达终点。


2026:驾驭工程时代,Agent成为数字生产力主体

里程碑事件

2026年2月5日,Harness Engineering理念正式提出

HashiCorp联合创始人Mitchell Hashimoto在个人博客发表万字长文,首次明确提出并命名 「Harness Engineering(驾驭工程)」
文中系统阐述了软件研发范式的变迁:第一代是手工编码,工程师亲手写每一行代码;第二代是AI辅助,Copilot帮你补全片段;第三代则是Agent执行,工程师的核心工作转变为设计规则、搭建环境、配置工具链、管控风险,通过“驾驭”AI Agent来稳定、可靠地交付工程结果。

这篇文章迅速在全球技术圈引发海啸级共鸣,被无数开发者与技术管理者转发。它不是某一款产品的发布,而是一种全新工程范式的宣言——AI不再是辅助工具,而是工程交付的执行主体,人则成为“驾驭者”与“设计师”。

2026年2月11日,OpenAI发布技术博客,验证驾驭工程可行性

OpenAI官方发布《Harness Engineering》技术博客,公布了一系列工业级实验结果:在零人工手写代码的前提下,仅通过设计Harness规则、环境约束与校验标准,引导AI Agent完成了一个百万行代码级别的复杂SaaS产品开发,最终代码质量、交付效率、可维护性均达到了专业中级团队的水平。

这篇博客从工程实践层面系统性验证了驾驭工程理念的可行性,直接推动该理念从社区讨论升级为全行业共识。各大科技公司纷纷启动研发流程重构,探索基于Agent的新型协作模式,Harness工程师、Agent训练师等新岗位也开始出现在招聘市场上。

2026年1-3月,OpenClaw现象级爆火,登顶GitHub历史星标榜

2025年末由奥地利开发者Peter Steinberger启动的周末项目ClawdBot,历经两次更名后最终定名 OpenClaw,在2026年初以病毒式传播速度爆火全球。
OpenClaw是一个通用端侧Agent:它可以直接操作电脑桌面,点击鼠标、输入文字、打开软件、处理文件,自主完成各种复杂的电脑操作。从整理文件、处理表格、批量回复邮件,到运营社交媒体、填写表单、处理日常办公流程,只要能用电脑完成的工作,它都能尝试自主完成。

2026年3月,OpenClaw的GitHub星标数突破25万,超越Linux内核与React框架,登顶GitHub非聚合类项目历史星榜第一名,成为有史以来增长最快的开源项目。国内开发者亲切地称它为“龙虾”,它的爆火彻底打破了“Agent只能写代码”的认知,让所有人直观感受到:通用AI Agent已经从科幻走进了现实。

2026年6月,Claude Fable 5发布,综合能力断层领先

Anthropic发布旗舰实验模型 Claude Fable 5 (High),在LMSYS Chatbot Arena等权威榜单上以14.00%的净提升幅度断层第一,大幅领先第二名的Claude Opus 4.8与第三名的GPT-5.5。
该模型在深度推理、代码工程、多步规划、指令遵循等核心维度都实现了阶跃式提升,尤其是配合Claude Code使用时,中大型项目的端到端交付成功率再创历史新高。很多一线开发者反馈,Fable 5级别的模型已经能独立完成80%以上的常规开发任务,人类只需要做需求确认、架构把关与最终验收。

与此同时,Claude Code生态也同步完成升级,Skills市场、Hooks插件体系、MCP工具生态全面成熟,从一个命令行工具进化为完整的Agent编程操作系统。

2026年Q1-Q2,国内掀起“百虾大战”,端侧Agent全面开花

OpenClaw爆火后,国内科技行业展现出惊人的跟进速度与创新活力。短短三个月内,市场上涌现出数十款端侧Agent产品,被网友戏称为“百虾大战”:

  • 头部互联网大厂悉数入场,推出各自的通用端侧Agent产品,深度绑定自身的办公、内容、云服务生态;
  • 创业公司聚焦垂直场景,在办公、设计、电商运营、客户服务等细分赛道做深度优化,走差异化路线;
  • 国产大模型的低成本优势充分显现,端侧Agent的使用门槛降到了几乎人人可用的程度,普通职场人都能轻松拥有自己的AI助理。

中国成为全球端侧Agent落地最活跃、竞争最激烈的市场,应用创新速度甚至反超海外,走出了一条独具特色的AI落地路径。

2026年中,MCP协议成为行业通用标准

经过一年多的生态建设,**MCP(模型上下文协议)**正式成为AI Agent领域的事实通用标准,其地位堪比AI时代的“USB接口”。

  • 几乎所有主流大模型、Agent工具、应用开发平台都宣布原生支持MCP协议;
  • 全球开发者贡献的MCP工具数量突破十万个,覆盖办公、开发、设计、运维、数据分析、企业服务等几乎所有数字工作场景;
  • MCP生态的成熟,让Agent真正实现了“一次开发、处处运行”,能力边界可以无限拓展。任何一款新软件、一项新服务,只要提供MCP适配,就能立刻被所有Agent使用。

技术动态

1. Harness Engineering体系走向成熟

随着理念普及,驾驭工程逐步形成了完整的方法论、工具体系与岗位分工:

  • 核心工作流:需求拆解 → 环境配置 → 规则设定 → Agent执行 → 结果校验 → 迭代优化,人的工作重心全面前移到设计、管控与验收环节;
  • 核心能力要求:新一代开发者需要掌握Prompt架构设计、工具链编排、安全边界设置、结果质量把控等新技能,“驾驭Agent的能力”逐渐取代“写代码的速度”,成为核心竞争力;
  • 组织架构变化:企业研发团队开始出现专门的Agent训练师、Harness工程师、Agent质量管控等新岗位,团队规模更精简,但人均产出呈指数级提升。

2. Agent核心架构体系走向成熟:底层循环 + 三大扩展机制

经过几年的工程化沉淀,行业对Agent的核心架构逐步形成了更清晰的分层认知:Agent Loop(代理循环)是所有Agent的底层运行基石,Skills、Hooks、MCP则是工程级Agent最核心的三大扩展机制。在以Claude Code为代表的代码Agent生态中,这一组合被开发者广泛认为是定制化Agent工作流的核心支柱。

  • Agent Loop(代理循环):即「目标拆解→环境观察→推理决策→行动执行→结果反馈→循环迭代」的闭环运行逻辑,是Agent区别于普通大模型应用的本质特征。ReAct、反思式规划等经典Agent范式,本质上都是不同的Loop实现。它支撑着所有上层扩展能力的运转,是Agent的「心跳机制」。
  • Skills(技能包):面向特定领域的知识规范、工作流程与最佳实践封装。例如React项目开发规范、数据库运维标准、代码审查规则、文档写作模板等,都可以被封装为独立的Skill。Agent加载后即可遵循对应领域的标准输出结果,相当于为Agent配备了「职业技能手册」,大幅提升垂直场景的专业性与一致性。
  • Hooks(钩子系统):基于Agent执行生命周期的事件触发机制。开发者可以在命令执行前、文件修改后、任务完成/失败等关键节点,插入自定义的校验逻辑、自动化操作或安全规则,比如高危命令人工确认、代码自动格式化、任务完成后自动提交Git等。它是实现个性化工作流、管控操作风险、保障输出质量的核心手段。
  • MCP(模型上下文协议):大模型与外部系统互联互通的通用开放协议。它定义了标准化的工具接入规范,数据库、浏览器、办公软件、云服务、第三方API等外部能力,只要完成MCP适配,就能被所有支持该协议的Agent直接调用。作为Agent时代的「通用外设接口」,MCP大幅降低了工具生态的适配成本,让Agent的能力边界可以无限拓展。

这套「底层循环 + 三大扩展」的架构体系,相关的设计规范、开源实现与最佳实践在2026年日趋成熟,推动Agent开发从零散的手工作坊模式,走向标准化、可复用的工业化模式。

3. 端侧Agent技术快速迭代

OpenClaw爆火之后,端侧Agent技术迎来爆发式进步,从“能用”快速走向“好用”:

  • 执行方式升级:从早期的模拟键鼠操作,进化为系统级API调用+视觉感知双模式,执行效率与稳定性大幅提升,出错率显著降低;
  • 多模态感知增强:Agent能够精准看懂屏幕内容、理解界面元素、识别操作状态,就像真人一样感知电脑环境,自主判断下一步操作;
  • 安全机制完善:权限分级、操作审计、人工接管、沙箱运行、敏感操作二次确认等功能全面落地,逐步打消了用户对安全风险的顾虑;
  • 云侧端侧协同:端侧小模型处理简单指令与界面感知,云端大模型负责复杂推理与规划,兼顾了速度、成本与隐私安全。

4. 大模型向“深度智能”持续进化

2026年的大模型,不再单纯比拼参数规模,而是向更深层的智能能力进化:

  • 深度思考能力:多步推理、自我反思、方案验证能力持续提升,Thinking模式的思考深度、准确性与稳定性再上台阶,复杂数学、逻辑、工程问题的解决能力大幅增强;
  • 工程化能力:长代码理解、系统架构设计、多文件协同、排错调试能力显著进步,模型真正具备了独立完成中大型项目的工程能力;
  • 多模态深度融合:文本、图像、音频、视频不再是简单拼接,而是实现了深度的语义统一,模型能够像人一样进行多模态综合感知与思考;
  • 市场格局:海外形成Claude Fable系列、GPT-5.5系列、Gemini 3.5系列三足鼎立的格局,各有侧重;国产模型中GLM 5.2、通义千问3.7、DeepSeek V4、豆包4.0等全面跻身全球第一梯队,部分场景实现反超。

5. 编程工具生态全面Agent化

AI编程工具在2026年完成了全面的Agent化升级,整个赛道格局清晰:

  • IDE形态:Cursor、Windsurf等原生AI编辑器全面升级为Agent IDE,不仅能生成代码,还能自主运行、调试、测试、部署,完成全流程开发任务;
  • 命令行形态:Claude Code、Codex CLI持续迭代,生态越来越完善,是重度开发者与工程团队的首选;
  • 开源方案:OpenCode等开源代码Agent快速成熟,支持私有化部署、多模型自由切换,满足企业定制化与数据安全需求;
  • 传统IDE全面跟进:VS Code、JetBrains全家桶都内置了深度集成的Agent能力,AI编程从“加分插件”彻底变成了“基础设施工具”。

6. 数字劳动力开始规模化落地

Agent技术的成熟,催生了真正意义上的“数字劳动力”,并开始从科技行业向千行百业扩散:

  • 企业开始大规模部署各类数字员工,包括开发工程师、数据分析师、客服专员、内容运营、行政助理等,承担标准化、重复性的工作;
  • 人机协作模式转变为“一人驾驭多Agent”,一个人类员工可以同时管理多个数字助理,工作效率呈指数级提升;
  • 工作评价标准从“工作量”转向“成果质量”,人的价值更多体现在创意、决策、架构、沟通、复杂问题处理等高阶能力上;
  • 教育、培训、职场技能体系都开始随之调整,全社会都在适应这场由AI带来的生产力变革。

年度总结

2026年是驾驭工程的元年,也是Agent真正成为数字生产力主体的一年。
从2023年的代码补全,到2025年的Vibe Coding,再到2026年的Harness Engineering,人类与AI的协作关系完成了两次关键跃迁:第一次是从“全手写”到“AI辅助”,工具服务于人;第二次是从“人主导执行”到“人驾驭Agent”,AI成为执行主体。

OpenClaw的爆火让普通职场人也感受到了Agent的威力,国内的“百虾大战”则让中国市场成为了全球AI应用创新的热土。模型能力还在持续进化,Agent生态还在快速繁荣,数字劳动力的规模化落地才刚刚拉开序幕。

站在十年的节点回望,从2015年深度学习的星星之火,到2026年Agent的燎原之势,AI的发展速度远超所有人的预期。下一个十年,AI会走向更强的通用人工智能,还是走向更深的人机共生?没有人能给出确切答案,但可以确定的是:这场重塑世界的变革,才刚刚开始。


十年AI发展全景总览表

年份基础理论与架构海外旗舰大模型国内旗舰大模型AI编程工具Agent与协议标准开源与本地化应用开发平台
2015ResNet残差网络;深度学习产业化百度大脑对外开放TensorFlow开源
2016深度强化学习突破;Seq2Seq成熟讯飞语音商用落地Caffe/Theano/Torch生态
2017Transformer架构诞生;AlphaGo Zero阿里达摩院成立;飞桨开源PyTorch正式发布
2018预训练+微调范式确立GPT-1、BERT百度ERNIEHugging Face Transformers发布
2019缩放定律验证;T5统一文本范式GPT-2大厂百亿模型启动Codex内部研发开源模型向亿级演进
2020少样本学习涌现;Prompt萌芽GPT-3、CodexGLM初代版本GitHub Copilot内测启动开源大模型起步
2021宪法式AI对齐;CLIP多模态对齐字节启动大模型专项GitHub Copilot预览Prompt工程兴起开源代码模型跟进
2022ReAct Agent框架;RLHF成熟ChatGPT (GPT-3.5)百模大战前夜Copilot正式版Agent理论奠基Stable Diffusion开源LangChain发布
2023多模态技术成熟;RAG广泛落地GPT-4、Claude 2、Grok Beta通义千问、豆包、智谱清言、KimiCursor崭露头角;Copilot X函数调用成标配开源多模态爆发Dify成立
2024长上下文技术突破;MCP协议提出Claude 3、GPT-4o、Gemini豆包大模型、腾讯元宝、DeepSeek V3Windsurf发布MCP协议首次提出Ollama普及;Chatbox/Cherry Studio兴起Dify生态成熟
2025Thinking推理模式;Vibe Coding理念Claude 4、GPT-5系列DeepSeek R1、GLM 5、通义3.xClaude Code、Codex CLISkills / Hooks落地开源Agent生态繁荣Coze发布
2026Harness Engineering共识;Agent 扩展体系化Claude Fable 5、GPT-5.5GLM 5.2、通义3.7、DeepSeek V4OpenClaw爆火;全工具Agent化MCP成为行业标准OpenClaw开源生态爆发全平台能力完善

后记

文章由豆包粗略生成,主要是简单总结下ai发展历史,以后有机会手动整理一个全面且细致的。

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐