自然语言处理(Natural Language Processing,NLP)是人工智能与语言学的交叉领域,目标是让计算机能够理解、解释、生成人类语言。从最早的基于规则的方法,到统计方法,再到当前基于深度学习的预训练大模型,NLP 经历了三代技术演进。
核心任务
- 理解类:文本分类、情感分析、命名实体识别、机器翻译
- 生成类:文本生成、摘要、问答、对话
- 语音类:语音识别(ASR)、语音合成(TTS)
技术里程碑
2018年 Google 发布 BERT,首次实现双向语义理解;2022年底 ChatGPT 发布,基于 GPT 系列模型把对话式AI推向大众。当前的大语言模型(LLM)本质上就是 NLP 技术在"规模+生成"方向上的极致体现。
难点
语言的歧义性(一词多义)、上下文依赖、文化差异。大模型通过在海量语料上预训练,学会了语言的深层规律,使机器翻译、智能客服、AI写作等应用达到了实用水平。