← Topics

LLM Compression via Quantization and Pruning

Papers on reducing model size and computational cost through quantization (including low-bit formats like 4-bit), pruning, and second-order optimization methods like Kronecker-factored Hessians applied to large language models.

quantizationpruningactivationblockskroneckerfactoredhessiangptqsae

Papers

9

Last 4 weeks

9

New topic

Papers per week

Jun 8Jul 20Aug 24

Papers