Типы квантизации: FP16, INT8, INT4
Технические форматы представления весов нейросетей. От полной 16-битной точности с плавающей запятой (FP16 / BF16) до целочисленных форматов сжатия (INT8, INT4, AWQ, EXL2), которые определяют баланс между потреблением памяти и интеллектуальным качеством ответов.
1. Обзор концепции и системная проблема
Каждое знание нейросети — это число. Но компьютер может хранить одно число по-разному:
- Можно записать его с максимальной точностью до 10 знаков после запятой (как в лаборатории физики).
- А можно округлить до ближайшего целого (как сдачу в магазине).
Типы квантизации (FP16, INT8, INT4) — это выбор того, сколько бит памяти вы готовы выделить на запись каждого из миллиардов параметров модели.
Ключевой инженерный принцип: как разрешение видео: 4K Ultra HD (FP16), хороший Full HD (INT8) или оптимизированный 720p (INT4). Для большинства экранов 720p выглядит отлично, но загружается в 4 раза быстрее.
2. Архитектурная таксономия и ментальная модель
| Формат | Сколько бит на число | Размер модели 8B | Точность логики | Где используется |
|---|---|---|---|---|
| FP16 / BF16 | 16 бит (2 байта) | ~16 ГБ | 100% (Эталон) | Серверы облачного обучения |
| INT8 | 8 бит (1 байт) | ~8.5 ГБ | 99.5% от эталона | Серверы для дешевого API |
| INT4 (Q4) | 4 бита (0.5 байта) | ~4.8 ГБ | 97.0% от эталона | Домашние ПК и ноутбуки |
| INT2 (Q2) | 2 бита (0.25 байта) | ~2.5 ГБ | < 70% (Сбои) | Эксперименты энтузиастов |
3. Почему 4-битное сжатие (INT4) стало революцией
До 2023 года считалось, что если округлить числа до 4 бит (где есть лишь 16 возможных значений: от 0 до 15), языковая модель полностью сойдет с ума.
Но ученые изобрели умные методы (такие как AWQ — Activation-aware Weight Quantization и GGUF K-quants):
- Они выяснили, что лишь 1% весов модели являются «критически важными» для разума.
- Этот 1% оставляют в высокой точности, а остальные 99% чисел смело сжимают до 4 бит.
- В результате модель похудела в 3.5 раза, сохранив почти 98% своего оригинального интеллекта!
4. Практические инженерные сценарии в продакшене
01. Выбор формата для облачных серверов
При наличии большого объема VRAM ➔ выбирайте INT8 (Q8) для максимальной эстетики текста.
02. Оптимизация для локальных приложений
При ограниченной памяти ➔ всегда выбирайте INT4 (Q4_K_M). Это непревзойденный золотой стандарт.
03. Эксперименты с новыми форматами
Используйте INT2 (Q2) только для тестирования, так как он не подходит для серьезных задач.
5. Подводные камни, типовые ошибки и безопасность
При работе с квантизацией важно помнить о следующих рисках:
- Сжатие до 2 бит может привести к значительным потерям в качестве и функциональности модели.
- Неправильный выбор формата может вызвать «галлюцинации» в ответах модели.
- Всегда тестируйте производительность модели после изменения формата, чтобы избежать неожиданных сбоев.
FAQ: Типы квантизации: FP16, INT8, INT4
Связанные термины
Квантизация и формат GGUF
Математический метод уменьшения точности числовых весов модели (например, с 16-битного FP16 до 4-битного INT4) и унифицированный бинарный файл формата GGUF для мгновенной загрузки в процессоры и видеокарты через движок llama.cpp.
Видеопамять (VRAM) для ИИ
Видеопамять графического процессора (Video RAM) используется для загрузки весов нейросети и контекстного окна. Основное аппаратное узкое место: если модель не помещается в VRAM, она либо не запустится, либо будет работать в десятки раз медленнее на обычном процессоре.
Количество Параметров Модели (7B, 14B, 70B)
Обозначение общего количества обучающих параметров (весов) в большой языковой модели, где буква 'B' означает миллиарды (Billion). Главный показатель интеллектуальной емкости модели, скорости ее работы и требований к объему памяти компьютера.