LLaMA 深度解读:用更少参数、更多数据通往最优推理
基于 Meta AI 2023 年论文 LLaMA,深入浅出地介绍其核心理念:用更小的模型、更多的数据训练出推理最优的大语言模型。 ...
基于 Meta AI 2023 年论文 LLaMA,深入浅出地介绍其核心理念:用更小的模型、更多的数据训练出推理最优的大语言模型。 ...
「速通 AI」系列第二篇:掌握深度学习核心概念,熟练使用 PyTorch 框架。 ...
聚焦大语言模型工程实践:预训练数据工程、SFT/RLHF/DPO 微调对齐、分布式训练(数据并行/张量并行/流水线并行/ZeRO)、混合精度训练、梯度累积、显存优化与训练稳定性监控。 ...
系统性梳理现代大语言模型背后的核心训练机制:从因果注意力到 Transformer 架构,从损失函数的数学本质到优化器,再到正则化与泛化,构建完整知识图谱。 ...