Skip to main content

Типи квантування: FP16, INT8, INT4(Формати FP16, INT8, INT4: у чому різниця між бітами та точністю обчислень)

Технічні формати представлення ваг нейромереж. Від повної 16-бітної точності з плаваючою комою (FP16 / BF16) до цілочисельних форматів стиснення (INT8, INT4, AWQ, EXL2), що визначають баланс між споживанням пам'яті та інтелектуальною якістю відповідей.

1. Огляд концепції та призначення

Кожне знання нейромережі — це число. Але комп'ютер може зберігати одне число по-різному:

  • Можна записати його з максимальною точністю до 10 знаків після коми (як у лабораторії фізики).
  • А можна округлити до найближчого цілого (як решту в магазині).

Типи квантування (FP16, INT8, INT4) — це вибір того, скільки бітів пам'яті ви готові виділити на запис кожного з мільярдів параметрів моделі.

Ключовий інженерний принцип: як роздільна здатність відео: 4K Ultra HD (FP16), гарний Full HD (INT8) або оптимізований 720p (INT4). Для більшості екранів 720p виглядає чудово, але завантажується в 4 рази швидше.

2. Порівняльна таблиця форматів точності

ФорматСкільки біт на числоРозмір моделі 8BТочність логікиДе використовується
FP16 / BF1616 біт (2 байти)~16 ГБ100% (Еталон)Сервери хмарного навчання
INT88 біт (1 байт)~8.5 ГБ99.5% від еталонуСервери для дешевого API
INT4 (Q4)4 біти (0.5 байта)~4.8 ГБ97.0% від еталонуДомашні ПК та ноутбуки
INT2 (Q2)2 біти (0.25 байта)~2.5 ГБ< 70% (Збої)Експерименти ентузіастів

3. Чому 4-бітне стиснення (INT4) стало революцією

До 2023 року вважалося, що якщо округлити числа до 4 біт (де є лише 16 можливих значень: від 0 до 15), мовна модель повністю збожеволіє.

Але вчені винайшли розумні методи (такі як AWQ — Activation-aware Weight Quantization та GGUF K-quants):

  • Вони з'ясували, що лише 1% ваг моделі є «критично важливими» для розуму.
  • Цей 1% залишають у високій точності, а решту 99% чисел сміливо стискають до 4 біт.
  • В результаті модель схудла в 3.5 рази, зберігши майже 98% свого оригінального інтелекту!

4. Практичний висновок

Коли ви обираєте формат моделі в локальних програмах (LM Studio, Ollama):

  • Якщо у вас багато VRAM ➔ обирайте INT8 (Q8) для максимальної естетики тексту.
  • Якщо пам'ять обмежена ➔ завжди беріть INT4 (Q4_K_M). Це неперевершений золотий стандарт.
/ Часті запитанняSchema.org FAQPage

FAQ: Типи квантування: FP16, INT8, INT4

FP означає Floating Point (число з плаваючою комою, тобто десятковий дріб на кшталт 3.1415). INT означає Integer (ціле число без дробової частини, наприклад 1, 2, 7, 12). Цілі числа займають набагато менше пам'яті в комп'ютерних мікрочипах.
/ Внутрішня перелінковка
Всі терміни
Моделі & Інференс

Квантування та формат GGUF

Математичний метод зменшення точності числових ваг моделі (наприклад, з 16-бітного FP16 до 4-бітного INT4) та уніфікований бінарний файл формату GGUF для миттєвого завантаження в процесори й відеокарти через рушій llama.cpp.

Читати термін
Моделі & Інференс

Відеопам'ять (VRAM) для ШІ

Відеопам'ять графічного процесора (Video RAM), у яку завантажуються ваги нейромережі та контекстне вікно. Головне апаратне вузьке місце: якщо модель не поміщається у VRAM, вона або не запуститься, або працюватиме в десятки разів повільніше на звичайному процесорі.

Читати термін
Моделі & Інференс

Кількість параметрів моделі (7B, 14B, 70B)

Позначення загальної кількості навчальних параметрів (ваг) у великій мовній моделі, де буква 'B' означає мільярди (Billion). Головний показник інтелектуальної місткості моделі, швидкості її роботи та вимог до обсягу пам'яті комп'ютера.

Читати термін