Типи квантування: FP16, INT8, INT4(Формати FP16, INT8, INT4: у чому різниця між бітами та точністю обчислень)
Технічні формати представлення ваг нейромереж. Від повної 16-бітної точності з плаваючою комою (FP16 / BF16) до цілочисельних форматів стиснення (INT8, INT4, AWQ, EXL2), що визначають баланс між споживанням пам'яті та інтелектуальною якістю відповідей.
1. Огляд концепції та призначення
Кожне знання нейромережі — це число. Але комп'ютер може зберігати одне число по-різному:
- Можна записати його з максимальною точністю до 10 знаків після коми (як у лабораторії фізики).
- А можна округлити до найближчого цілого (як решту в магазині).
Типи квантування (FP16, INT8, INT4) — це вибір того, скільки бітів пам'яті ви готові виділити на запис кожного з мільярдів параметрів моделі.
Ключовий інженерний принцип: як роздільна здатність відео: 4K Ultra HD (FP16), гарний Full HD (INT8) або оптимізований 720p (INT4). Для більшості екранів 720p виглядає чудово, але завантажується в 4 рази швидше.
2. Порівняльна таблиця форматів точності
| Формат | Скільки біт на число | Розмір моделі 8B | Точність логіки | Де використовується |
|---|---|---|---|---|
| FP16 / BF16 | 16 біт (2 байти) | ~16 ГБ | 100% (Еталон) | Сервери хмарного навчання |
| INT8 | 8 біт (1 байт) | ~8.5 ГБ | 99.5% від еталону | Сервери для дешевого API |
| INT4 (Q4) | 4 біти (0.5 байта) | ~4.8 ГБ | 97.0% від еталону | Домашні ПК та ноутбуки |
| INT2 (Q2) | 2 біти (0.25 байта) | ~2.5 ГБ | < 70% (Збої) | Експерименти ентузіастів |
3. Чому 4-бітне стиснення (INT4) стало революцією
До 2023 року вважалося, що якщо округлити числа до 4 біт (де є лише 16 можливих значень: від 0 до 15), мовна модель повністю збожеволіє.
Але вчені винайшли розумні методи (такі як AWQ — Activation-aware Weight Quantization та GGUF K-quants):
- Вони з'ясували, що лише 1% ваг моделі є «критично важливими» для розуму.
- Цей 1% залишають у високій точності, а решту 99% чисел сміливо стискають до 4 біт.
- В результаті модель схудла в 3.5 рази, зберігши майже 98% свого оригінального інтелекту!
4. Практичний висновок
Коли ви обираєте формат моделі в локальних програмах (LM Studio, Ollama):
- Якщо у вас багато VRAM ➔ обирайте INT8 (Q8) для максимальної естетики тексту.
- Якщо пам'ять обмежена ➔ завжди беріть INT4 (Q4_K_M). Це неперевершений золотий стандарт.
FAQ: Типи квантування: FP16, INT8, INT4
Пов'язані терміни
Квантування та формат GGUF
Математичний метод зменшення точності числових ваг моделі (наприклад, з 16-бітного FP16 до 4-бітного INT4) та уніфікований бінарний файл формату GGUF для миттєвого завантаження в процесори й відеокарти через рушій llama.cpp.
Відеопам'ять (VRAM) для ШІ
Відеопам'ять графічного процесора (Video RAM), у яку завантажуються ваги нейромережі та контекстне вікно. Головне апаратне вузьке місце: якщо модель не поміщається у VRAM, вона або не запуститься, або працюватиме в десятки разів повільніше на звичайному процесорі.
Кількість параметрів моделі (7B, 14B, 70B)
Позначення загальної кількості навчальних параметрів (ваг) у великій мовній моделі, де буква 'B' означає мільярди (Billion). Головний показник інтелектуальної місткості моделі, швидкості її роботи та вимог до обсягу пам'яті комп'ютера.