Skip to main content

Типы квантизации: FP16, INT8, INT4

Технические форматы представления весов нейросетей. От полной 16-битной точности с плавающей запятой (FP16 / BF16) до целочисленных форматов сжатия (INT8, INT4, AWQ, EXL2), которые определяют баланс между потреблением памяти и интеллектуальным качеством ответов.

1. Обзор концепции и системная проблема

Каждое знание нейросети — это число. Но компьютер может хранить одно число по-разному:

  • Можно записать его с максимальной точностью до 10 знаков после запятой (как в лаборатории физики).
  • А можно округлить до ближайшего целого (как сдачу в магазине).

Типы квантизации (FP16, INT8, INT4) — это выбор того, сколько бит памяти вы готовы выделить на запись каждого из миллиардов параметров модели.

Ключевой инженерный принцип: как разрешение видео: 4K Ultra HD (FP16), хороший Full HD (INT8) или оптимизированный 720p (INT4). Для большинства экранов 720p выглядит отлично, но загружается в 4 раза быстрее.

2. Архитектурная таксономия и ментальная модель

ФорматСколько бит на числоРазмер модели 8BТочность логикиГде используется
FP16 / BF1616 бит (2 байта)~16 ГБ100% (Эталон)Серверы облачного обучения
INT88 бит (1 байт)~8.5 ГБ99.5% от эталонаСерверы для дешевого API
INT4 (Q4)4 бита (0.5 байта)~4.8 ГБ97.0% от эталонаДомашние ПК и ноутбуки
INT2 (Q2)2 бита (0.25 байта)~2.5 ГБ< 70% (Сбои)Эксперименты энтузиастов

3. Почему 4-битное сжатие (INT4) стало революцией

До 2023 года считалось, что если округлить числа до 4 бит (где есть лишь 16 возможных значений: от 0 до 15), языковая модель полностью сойдет с ума.

Но ученые изобрели умные методы (такие как AWQ — Activation-aware Weight Quantization и GGUF K-quants):

  • Они выяснили, что лишь 1% весов модели являются «критически важными» для разума.
  • Этот 1% оставляют в высокой точности, а остальные 99% чисел смело сжимают до 4 бит.
  • В результате модель похудела в 3.5 раза, сохранив почти 98% своего оригинального интеллекта!

4. Практические инженерные сценарии в продакшене

01. Выбор формата для облачных серверов

При наличии большого объема VRAM ➔ выбирайте INT8 (Q8) для максимальной эстетики текста.

02. Оптимизация для локальных приложений

При ограниченной памяти ➔ всегда выбирайте INT4 (Q4_K_M). Это непревзойденный золотой стандарт.

03. Эксперименты с новыми форматами

Используйте INT2 (Q2) только для тестирования, так как он не подходит для серьезных задач.

5. Подводные камни, типовые ошибки и безопасность

При работе с квантизацией важно помнить о следующих рисках:

  • Сжатие до 2 бит может привести к значительным потерям в качестве и функциональности модели.
  • Неправильный выбор формата может вызвать «галлюцинации» в ответах модели.
  • Всегда тестируйте производительность модели после изменения формата, чтобы избежать неожиданных сбоев.
/ Частые вопросыSchema.org FAQPage

FAQ: Типы квантизации: FP16, INT8, INT4

FP означает Floating Point (число с плавающей запятой, то есть десятичная дробь вроде 3.1415). INT означает Integer (целое число без дробной части, например 1, 2, 7, 12). Целые числа занимают гораздо меньше памяти в компьютерных микрочипах.
/ Внутренняя перелинковка
Все термины
Модели и Инференс

Квантизация и формат GGUF

Математический метод уменьшения точности числовых весов модели (например, с 16-битного FP16 до 4-битного INT4) и унифицированный бинарный файл формата GGUF для мгновенной загрузки в процессоры и видеокарты через движок llama.cpp.

Читать термин
Модели и Инференс

Видеопамять (VRAM) для ИИ

Видеопамять графического процессора (Video RAM) используется для загрузки весов нейросети и контекстного окна. Основное аппаратное узкое место: если модель не помещается в VRAM, она либо не запустится, либо будет работать в десятки раз медленнее на обычном процессоре.

Читать термин
Модели и Инференс

Количество Параметров Модели (7B, 14B, 70B)

Обозначение общего количества обучающих параметров (весов) в большой языковой модели, где буква 'B' означает миллиарды (Billion). Главный показатель интеллектуальной емкости модели, скорости ее работы и требований к объему памяти компьютера.

Читать термин