NLP的五次范式演进

自然语言处理经历了从基于规则的系统到统计方法,从词向量到Transformer,再到大语言模型的五次范式转移。每一次范式转移都重新定义了"理解语言"的含义。规则系统试图用形式文法描述语言,统计方法用概率分布表示语义,而大语言模型则通过海量数据中习得的涌现能力来处理语言。

词向量与语义表示

Word2Vec的Skip-gram和CBOW模型开创了分布式语义表示的先河——"国王-男人+女人= queen"的性质令研究者和工程师兴奋不已。GloVe则结合了全局矩阵分解和局部上下文窗口的优点。但词向量有一个致命缺陷:每个单词只有一个语义向量,无法处理多义性("bank"可以是银行或河岸)。

上下文化的词表示

ELMo利用双向LSTM生成上下文相关的词表示,同一词在不同句子中有不同向量。GPT系列采用单向Transformer Decoder架构,通过自回归预训练学习语言表示。BERT则采用双向Transformer Encoder,通过Masked LM任务挖掘上下文信息。这两种路线的分野——生成vs理解——一直延续到GPT-4和T5时代。

注意力机制的力量

Transformer的Self-Attention机制是以下三部曲:将每个token映射为Query、Key、Value向量;计算注意力分数作为权重;对Value向量加权求和得到新表示。Multi-Head Attention并行执行多组注意力计算,每组关注不同的语义关系。位置编码(Sinusoidal/RoPE)补充了序列位置信息。

大语言模型的训练

LLM训练分为四个阶段:预训练(Language Modeling on大规模语料)→ SFT(Supervised Fine-Tuning用人工指令数据对齐)→ RM训练(Reward Model学习人类偏好)→ PPO(Proximal Policy Optimization优化策略)。RLHF(基于人类反馈的强化学习)是ChatGPT成功的关键。

NLP工程应用

文本分类与情感分析

从fastText到BERT微调,文本分类的精度不断提升,噪声鲁棒性和多语言支持也在持续改善。LLM的Zero-shot分类能力正在挑战传统监督学习的地位。

命名实体识别与信息抽取

BiLSTM-CRF曾是NER的标准架构,如今BERT微调已大幅超越。LLM通过精心设计的Prompt实现开放式信息抽取,但其稳定性和成本仍有挑战。

检索增强生成RAG

RAG是当前最热的NLP应用方向。流程为:对用户Query进行Embedding,在向量数据库中检索相关文档片段,将其作为Context和Query一起输入LLM生成回答。RAG有效缓解了LLM幻觉和知识过期问题,但检索的准确性和Chunk策略的工程调优仍需持续改进。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿
网站二维码

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部