深度学习中的双下降现象(Double Descent)与缩放定律(Scaling Law)
详解深度学习理论基石:双下降现象(Double Descent Phenomenon)与模型缩放定律(Scaling Laws),以及它们的经典奠基论文。 ...
详解深度学习理论基石:双下降现象(Double Descent Phenomenon)与模型缩放定律(Scaling Laws),以及它们的经典奠基论文。 ...
「速通 AI」系列第八篇:大模型微调、量化、部署,以及 Agent 开发、MCP、LangGraph。 ...
「速通 AI」系列配套面试指南:覆盖数学基础、深度学习、Transformer、预训练模型、LLaMA、LLM 应用、RAG、Agent、综合题共 86 道高频面试题,每题附完整解答。 ...
基于 Meta AI 2023 年论文 LLaMA,深入浅出地介绍其核心理念:用更小的模型、更多的数据训练出推理最优的大语言模型。 ...
「速通 AI」系列第七篇:深入掌握 RAG 检索增强生成——向量数据库、高级检索策略、GraphRAG。 ...
「速通 AI」系列第六篇:掌握提示词工程、LangChain 框架、OpenAI API 调用。 ...
「速通 AI」系列第五篇:深入理解 LLaMA 架构的 5 大关键改进——RMSNorm、RoPE、SwiGLU、KV Cache、GQA。 ...
聚焦大语言模型推理优化与部署:模型量化(GPTQ/AWQ/SmoothQuant)、KV Cache 优化(GQA/PagedAttention)、投机解码、连续批处理、推理框架对比与边缘部署。 ...
聚焦大语言模型工程实践:预训练数据工程、SFT/RLHF/DPO 微调对齐、分布式训练(数据并行/张量并行/流水线并行/ZeRO)、混合精度训练、梯度累积、显存优化与训练稳定性监控。 ...
系统性梳理现代大语言模型背后的核心训练机制:从因果注意力到 Transformer 架构,从损失函数的数学本质到优化器,再到正则化与泛化,构建完整知识图谱。 ...