模型原理
阅读 2
评论 0
点赞 0
Transformer 与模型微调
Transformer基于Encoder-Decoder双模块架构,Encoder通过双向自注意力理解上下文,Decoder通过单向自注意力生成文本。自注意力机制以Q/K/V三向量交互为核心,结合多头注意力和位置编码实现全局语义建模。大模型(如GPT-4)是Transformer在数据和算力极致扩展的产物。主流架构包括Causal Decoder(LLaMA)、Prefix Decoder(ChatGLM)和Encoder-Decoder(T5),其中Decoder-only因训练高效、生成能力强成为主流。微调技术中,LoRA通过低秩矩阵仅训练1%~5%参数,适应多任务;RLHF分SFT、奖励模型、PPO三阶段对齐人类偏好,DPO可简化流程。实际应用中建议优先高质量指令数据,小数据量用Chat模型,大数据量用Base模型,RLHF可跳过奖励模型直接DPO。掌握这些核心知识能帮助高效落地大模型任务。