Dec 10, 2025 9 分钟阅读 DeNA LLM研究Part 3: 模型训练方法论 - 从预训练到RLHF/DPO 基于DeNA LLM研究资料Part 3,深入分析预训练、微调和强化学习的差异,以及LoRA、QLoRA、DPO等最新高效学习技术,帮助你理解各训练阶段的成本与适用场景。