Skip to main content

Попереднє навчання (Pre-training)(Pre-training: найдорожчий і найважчий етап народження штучного інтелекту)

Початковий етап створення базової великої мовної моделі (Foundation Model). Процес згодовування нейромережі трильйонів слів з інтернету, книг і коду на кластерах із тисяч відеокарт протягом місяців за десятки й сотні мільйонів доларів.

1. Огляд концепції та призначення

Коли нова нейромережа щойно створена на папері у вигляді програмного коду, її «мозок» абсолютно порожній. Усі її мільярди числових ваг заповнені випадковим шумом. Вона не відрізняє літеру «А» від крапки.

Попереднє навчання (Pre-training) — це етап, на якому порожня матриця перетворюється на універсальну базу людських знань:

  • Їй показують сотні мільярдів речень.
  • Вона намагається вгадати кожне наступне слово.
  • Коли помиляється — математика трохи підкручує її параметри (метод зворотного поширення помилки — Backpropagation).
  • Через три місяці безперервних обчислень на тисячах відеокарт модель бездоганно засвоює граматику, факти про світ, логіку та десятки мов.

Головний принцип для розробника: університетська освіта для ШІ: читання всіх книг бібліотеки протягом років без сну та відпочинку.

2. Масштаб промислового Pre-training

┌─────────────────────────────────────────────────────────────┐
│                 ФАБРИКА ПОПЕРЕДНЬОГО НАВЧАННЯ               │
├─────────────────────────────────────────────────────────────┤
│ 📚 ВХІДНІ ДАНІ:                                             │
│    15 трильйонів токенів (весь якісний інтернет людства)    │
├─────────────────────────────────────────────────────────────┤
│ ⚡ АПАРАТНА ПОТУЖНІСТЬ:                                     │
│    Кластер із 16 000 – 100 000 чипів Nvidia H100            │
├─────────────────────────────────────────────────────────────┤
│ ⏳ ЧАС І ВАРТІСТЬ:                                          │
│    90 – 120 днів безперервної роботи, $100,000,000+ витрат  │
├─────────────────────────────────────────────────────────────┤
│ 🎯 РЕЗУЛЬТАТ: БАЗОВА МОДЕЛЬ (Base Model)                    │
│    «Сирий геній», що знає все, але потребує виховання       │
└─────────────────────────────────────────────────────────────┘

3. Чому базові моделі рідко дають звичайним користувачам

Якщо ви відкриєте «сиру» базову модель (наприклад, Llama-3-Base замість Llama-3-Instruct) і напишете їй:

  • «Привіт, допоможи написати листа мамі»

Вона може відповісти:

  • «...і татові, і бабусі, і відправ його поштою на адресу вул. Центральна, 12. Розділ 2: Як правильно писати листи...»

Вона просто автодоповнює інтернет-сторінку! Щоб перетворити цей масив знань на послужливого помічника, потрібні наступні етапи: Fine-tuning та RLHF.

4. Практичний висновок

Оскільки провести Pre-training можуть лише гігантські корпорації (Google, Meta, Microsoft/OpenAI) або багаті венчурні стартапи, увесь світ користується їхніми плодами: або через платні API, або завантажуючи відкриті базові ваги (Open Weights).

/ Часті запитанняSchema.org FAQPage

FAQ: Попереднє навчання (Pre-training)

Навчання моделей покоління GPT-4 або Llama 3 коштувало від $50 до $150+ мільйонів доларів лише за витрачену електроенергію та амортизацію серверів з тисячами графічних прискорювачів Nvidia H100. Наступні покоління наближаються до вартості в $1 мільярд.
/ Внутрішня перелінковка
Всі терміни
Моделі & Інференс

Закони масштабування ШІ (Scaling Laws)

Емпіричний закон OpenAI та Google (сформульований Джаредом Капланом у 2020 році), який стверджує: продуктивність мовної моделі передбачувано зростає як степеневий закон при збільшенні трьох факторів: кількості параметрів моделі, обсягу тренувальних даних та витраченої обчислювальної потужності (Compute).

Читати термін
Моделі & Інференс

Тонке донавчання (Fine-Tuning)

Процес адаптації вже навченої великої моделі до вузькоспеціалізованого завдання або стилю за допомогою невеликого якісного датасету (Supervised Fine-Tuning, SFT). Дозволяє навчити ШІ медичній термінології, корпоративному тону або форматуванню специфічного коду за кілька годин.

Читати термін
Моделі & Інференс

Навчання з підкріпленням відгуками людей (RLHF)

Метод навчання (Reinforcement Learning from Human Feedback), що використовує порівняльні оцінки людей для тренування моделі винагороди (Reward Model). Саме завдяки RLHF мовні моделі навчилися бути корисними, чесними та безпечними (Helpful, Honest, Harmless).

Читати термін