<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Quantization on GopherDing's Blog</title><link>/tags/quantization/</link><description>Recent content in Quantization on GopherDing's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Wed, 04 Mar 2026 01:17:00 +0800</lastBuildDate><atom:link href="/tags/quantization/index.xml" rel="self" type="application/rss+xml"/><item><title>大语言模型训练机制全解·第三篇：高效推理与轻量部署核心技术</title><link>/posts/tech/%E5%A4%A7%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E8%AE%AD%E7%BB%83%E6%9C%BA%E5%88%B6%E5%85%A8%E8%A7%A3_%E7%AC%AC%E4%B8%89%E7%AF%87/</link><pubDate>Wed, 04 Mar 2026 01:17:00 +0800</pubDate><guid>/posts/tech/%E5%A4%A7%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E8%AE%AD%E7%BB%83%E6%9C%BA%E5%88%B6%E5%85%A8%E8%A7%A3_%E7%AC%AC%E4%B8%89%E7%AF%87/</guid><description>聚焦大语言模型推理优化与部署：模型量化（GPTQ/AWQ/SmoothQuant）、KV Cache 优化（GQA/PagedAttention）、投机解码、连续批处理、推理框架对比与边缘部署。</description></item></channel></rss>