Попереднє навчання (Pre-training)(Pre-training: найдорожчий і найважчий етап народження штучного інтелекту)
Початковий етап створення базової великої мовної моделі (Foundation Model). Процес згодовування нейромережі трильйонів слів з інтернету, книг і коду на кластерах із тисяч відеокарт протягом місяців за десятки й сотні мільйонів доларів.
1. Огляд концепції та призначення
Коли нова нейромережа щойно створена на папері у вигляді програмного коду, її «мозок» абсолютно порожній. Усі її мільярди числових ваг заповнені випадковим шумом. Вона не відрізняє літеру «А» від крапки.
Попереднє навчання (Pre-training) — це етап, на якому порожня матриця перетворюється на універсальну базу людських знань:
- Їй показують сотні мільярдів речень.
- Вона намагається вгадати кожне наступне слово.
- Коли помиляється — математика трохи підкручує її параметри (метод зворотного поширення помилки — Backpropagation).
- Через три місяці безперервних обчислень на тисячах відеокарт модель бездоганно засвоює граматику, факти про світ, логіку та десятки мов.
Головний принцип для розробника: університетська освіта для ШІ: читання всіх книг бібліотеки протягом років без сну та відпочинку.
2. Масштаб промислового Pre-training
┌─────────────────────────────────────────────────────────────┐
│ ФАБРИКА ПОПЕРЕДНЬОГО НАВЧАННЯ │
├─────────────────────────────────────────────────────────────┤
│ 📚 ВХІДНІ ДАНІ: │
│ 15 трильйонів токенів (весь якісний інтернет людства) │
├─────────────────────────────────────────────────────────────┤
│ ⚡ АПАРАТНА ПОТУЖНІСТЬ: │
│ Кластер із 16 000 – 100 000 чипів Nvidia H100 │
├─────────────────────────────────────────────────────────────┤
│ ⏳ ЧАС І ВАРТІСТЬ: │
│ 90 – 120 днів безперервної роботи, $100,000,000+ витрат │
├─────────────────────────────────────────────────────────────┤
│ 🎯 РЕЗУЛЬТАТ: БАЗОВА МОДЕЛЬ (Base Model) │
│ «Сирий геній», що знає все, але потребує виховання │
└─────────────────────────────────────────────────────────────┘
3. Чому базові моделі рідко дають звичайним користувачам
Якщо ви відкриєте «сиру» базову модель (наприклад, Llama-3-Base замість Llama-3-Instruct) і напишете їй:
- «Привіт, допоможи написати листа мамі»
Вона може відповісти:
- «...і татові, і бабусі, і відправ його поштою на адресу вул. Центральна, 12. Розділ 2: Як правильно писати листи...»
Вона просто автодоповнює інтернет-сторінку! Щоб перетворити цей масив знань на послужливого помічника, потрібні наступні етапи: Fine-tuning та RLHF.
4. Практичний висновок
Оскільки провести Pre-training можуть лише гігантські корпорації (Google, Meta, Microsoft/OpenAI) або багаті венчурні стартапи, увесь світ користується їхніми плодами: або через платні API, або завантажуючи відкриті базові ваги (Open Weights).
FAQ: Попереднє навчання (Pre-training)
Пов'язані терміни
Закони масштабування ШІ (Scaling Laws)
Емпіричний закон OpenAI та Google (сформульований Джаредом Капланом у 2020 році), який стверджує: продуктивність мовної моделі передбачувано зростає як степеневий закон при збільшенні трьох факторів: кількості параметрів моделі, обсягу тренувальних даних та витраченої обчислювальної потужності (Compute).
Тонке донавчання (Fine-Tuning)
Процес адаптації вже навченої великої моделі до вузькоспеціалізованого завдання або стилю за допомогою невеликого якісного датасету (Supervised Fine-Tuning, SFT). Дозволяє навчити ШІ медичній термінології, корпоративному тону або форматуванню специфічного коду за кілька годин.
Навчання з підкріпленням відгуками людей (RLHF)
Метод навчання (Reinforcement Learning from Human Feedback), що використовує порівняльні оцінки людей для тренування моделі винагороди (Reward Model). Саме завдяки RLHF мовні моделі навчилися бути корисними, чесними та безпечними (Helpful, Honest, Harmless).