大语言模型训练机制全解·第三篇:高效推理与轻量部署核心技术
聚焦大语言模型推理优化与部署:模型量化(GPTQ/AWQ/SmoothQuant)、KV Cache 优化(GQA/PagedAttention)、投机解码、连续批处理、推理框架对比与边缘部署。 ...
聚焦大语言模型推理优化与部署:模型量化(GPTQ/AWQ/SmoothQuant)、KV Cache 优化(GQA/PagedAttention)、投机解码、连续批处理、推理框架对比与边缘部署。 ...
结合 NGA 社区多轮实测结论与行业通用标准,彻底搞懂 HandBrake 的底层逻辑,找到画质、体积、速度三者的最优平衡点。 ...
聚焦大语言模型工程实践:预训练数据工程、SFT/RLHF/DPO 微调对齐、分布式训练(数据并行/张量并行/流水线并行/ZeRO)、混合精度训练、梯度累积、显存优化与训练稳定性监控。 ...
关于CS5494——Generative AI的课程描述 ...
系统性梳理现代大语言模型背后的核心训练机制:从因果注意力到 Transformer 架构,从损失函数的数学本质到优化器,再到正则化与泛化,构建完整知识图谱。 ...
以人话和鬼话两种方式解释了一下go的读写锁 ...
字节跳动团队在异地单元化架构落地上的一些思考和实践 ...
很好的文章,大道至简 ...
常见消息队列的技术选型
GitLab CICD 和 Argo CD区别与选型