# Локальні LLM та Gemma 4: Повний гайд

> Детальна інструкція про те, як працюють локальні нейромережі, що таке HuggingFace та Ollama, і як запустити потужну модель Gemma 4 навіть на звичайному комп'ютері.

## 1. Концепція локальних LLM та їх переваги

> [!TIP]
> **Що таке локальні моделі та чому вони популярні?**
> Зараз локальні моделі дуже швидко наздоганяють великі закриті аналоги. Наприклад, Gemma 4 за своїми можливостями працює приблизно на рівні GPT-4O Mini.
>
> - **Конфіденційність:** Ваші дані не покидають ваш комп'ютер.
> - **Офлайн доступ:** Модель працює навіть коли немає інтернету.
> - **Гнучкість:** Можливість донавчання (файн-тюнінг) під конкретні завдання (написання текстів, код, медицина).

## 2. Можливості та особливості сімейства Gemma 4

Компанія Google випустила ціле сімейство моделей Gemma 4, які мають низку вагомих переваг:

- **Дві маленькі моделі (2,4B параметрів):** Ідеально підходять для телефонів, малих пристроїв (наприклад, Raspberry Pi).
- **Дві великі моделі (26B та 31B параметрів):** Призначені для потужних комп'ютерів. На свої параметри вони показують вищі бенчмарки, ніж деякі 100-мільярдні моделі (наприклад, DeepSeek V3).
- **Агентські можливості (Tool Calling):** Модель може викликати функції і створювати повноцінні агентські системи.
- **Мультимодальність:** Gemma 4 вміє розпізнавати аудіо та зображення, а також генерувати їх.
- **Відкрита ліцензія (Apache 2):** На відміну від попередніх версій, ви можете використовувати її у комерційних цілях без обмежень.

## 3. Навігація в HuggingFace та маркетплейс моделей

- **Unsloth:** Автор або організація, яка оптимізувала і виклала модель.
- **Gemma 4:** Назва самої моделі.
- **24B:** Кількість параметрів (24 мільярди).
- **A4BIT:** З 24 мільярдів параметрів активно використовуються лише 4 мільярди завдяки технології MoE/квантизації.
- **IT (Instruction Tuned):** Найважливіший параметр. Це означає, що модель натренована як чат, тобто розуміє інструкції та веде діалог (а не просто продовжує текст).
- **GGUF:** Формат файлу, оптимізований для локального запуску через Ollama або LM Studio.

## 4. Файн-тюнінг та технології стиснення моделей

Щоб великі моделі можна було запускати на домашніх комп'ютерах, застосовують два ключові підходи:

- **Квантизація (Quantization):** Зниження розрядності ваг моделі (наприклад, переведення з FP16 у 4-бітний GGUF), що зменшує вимоги до відеопам'яті (VRAM) у 3–4 рази майже без деградації логіки.
- **Файн-тюнінг (Fine-tuning):** Донавчання базової моделі на спеціалізованому датасеті з використанням адаптерів LoRA/QLoRA для досягнення експертного рівня у вузьких предметних областях.

## 5. Встановлення та використання Ollama

**Ollama** — це один із найпростіших застосунків для управління локальними моделями.

- 1. Зайдіть на офіційний сайт Ollama та завантажте десктопну версію (для macOS, Windows або Linux).
- 2. Після встановлення, створіть акаунт у них на сайті.
- 3. Щоб завантажити модель з HuggingFace, скопіюйте команду для запуску (наприклад, `ollama run...`) зі сторінки моделі.
- 4. Відкрийте термінал і вставте цю команду. Дочекайтеся завершення завантаження.
- 5. Після цього ви зможете спілкуватись з моделлю прямо у додатку Ollama або через термінал (відповіді генеруються швидко — близько 6-8 секунд на прості питання).

## 6. Хмарна інтеграція та зв'язка з Claude Code

Якщо ваш комп'ютер не витягує важкі моделі, Ollama має чудову **хмарну альтернативу**. Ви можете підключити хмарну версію важкої Gemma 4 (31B параметрів) і працювати з нею локально без навантаження на систему.

- Щоб використовувати локальну або хмарну модель як AI-асистента розробника, можна інтегрувати їх в **Claude Code**.
- Запустивши Claude Code, виберіть потрібну модель (наприклад, хмарну Gemma 4) зі списку Ollama.
- Дайте запит, і модель напише код або створить файл (наприклад, HTML-презентацію або веб-сторінку) прямо у вашій папці проєкту.