Skip to main content

Квантування та формат GGUF(Квантування та GGUF: як стиснути гігантську модель у 4 рази без втрати розуму)

Математичний метод зменшення точності числових ваг моделі (наприклад, з 16-бітного FP16 до 4-бітного INT4) та уніфікований бінарний файл формату GGUF для миттєвого завантаження в процесори й відеокарти через рушій llama.cpp.

1. Огляд концепції та призначення

Коли лабораторії на кшталт Meta або Mistral завершують навчання нейромережі, її параметри зберігаються у надвисокій математичній точності (16-бітні числа з плаваючою комою — FP16). Модель на 8 мільярдів параметрів у такому вигляді важить близько 16 ГБ, а модель на 70 мільярдів — понад 140 ГБ! Жодна звичайна домашня відеокарта такий файл не відкриє.

Квантування (Quantization) — це математичне «округлення»:

  • Замість запису чисел на кшталт 3.14159265 ми округлюємо їх до коротких 4-бітних цілих чисел від 0 до 15.
  • Розмір моделі зменшується в 3–4 рази.
  • Вона миттєво поміщається в пам'ять бюджетного ноутбука.

Головний принцип для розробника: MP3-стиснення для штучного інтелекту: розмір зменшується в рази, а людське вухо (чи користувач у чаті) майже не відчуває різниці.

2. Як числа стискаються під час квантування

ОРИГІНАЛ (FP16 - 16 біт на кожне число):
[ 0.8329104 ] [ -0.1982735 ] [ 0.0482910 ]
--> 16 ГБ розміру моделі (Потрібна серверна відеокарта)

        ▼ ПРОЦЕС КВАНТУВАННЯ (Зменшення розрядності)

КВАНТОВАНА ВЕРСІЯ (Q4_K_M - 4 біти на кожне число):
[ 13 ]        [ 2 ]          [ 7 ]
--> Лише 4.8 ГБ розміру моделі (Працює на домашній карті на 8 ГБ)

3. Таблиця вибору варіантів квантування

Маркування GGUFБітиЯкість відповідейРекомендація
Q8_08 біт99.8% від оригіналуДля ентузіастів із запасом пам'яті
Q5_K_M5 біт98.5% від оригіналуЧудовий вибір, якщо вистачає VRAM
Q4_K_M4 біти97.0% від оригіналуЗолотий стандарт: обирайте за замовчуванням
Q3_K_M3 біти90.0% від оригіналуКоли модель не вміщується, але дуже хочеться запустити
Q2_K2 біти< 75% (можливі збої)Не рекомендується для серйозних завдань

4. Практичний висновок

Якщо ви завантажуєте модель для локального чату в LM Studio чи через Ollama, завжди вибирайте версію з поміткою Q4_K_M або Q5_K_M. Це гарантує максимальну швидкість генерації при мінімальному навантаженні на ваше залізо.

/ Часті запитанняSchema.org FAQPage

FAQ: Квантування та формат GGUF

Це тип стиснення: «Q4» означає 4-бітне квантування (найпопулярніший баланс між вагою моделі та якістю розуміння), «Q8» — 8-бітне (дуже висока точність, але займає вдвічі більше пам'яті), «K_M» — метод оптимізації середніх матриць для збереження критично важливих ваг.
/ Внутрішня перелінковка
Всі терміни