Катастрофічне забування (Catastrophic Forgetting)(Катастрофічне забування: чому нейромережі втрачають старі знання при навчанні новому)
Фундаментальна проблема штучних нейронних мереж, коли при навчанні новому завданню або іншій мові оновлені вагові коефіцієнти перезаписують попередні зв'язки, призводячи до раптової та повної втрати раніше набутих навичок.
1. Огляд концепції та призначення
Уявіть шахіста-гросмейстера, який вирішив навчитися грати в теніс. Він бере ракетку, тренується місяць, виходить на корт... але коли повертається за шахівницю, раптом виявляє, що взагалі не пам'ятає, як ходить кінь або пішак.
Для людини це звучить абсурдно. Але для штучних нейромереж це сувора інженерна реальність.
Катастрофічне забування (Catastrophic Forgetting) — це явище, коли нові знання буквально витісняють і стирають старі:
- Всі знання моделі — це єдине полотно взаємопов'язаних чисел (ваг).
- Коли ви вчите модель новому завданню, алгоритм коригує ці числа.
- Оновлення під нову задачу може зруйнувати тонкі налаштування, які відповідали за іншу навичку.
Суть концепції проста: нагадування: не можна просто «докинути файлик» у ваги моделі без ризику зламати її попередній розум.
2. Як нові знання стирають старі
┌─────────────────────────────────────────────────────────────┐
│ КАТАСТРОФІЧНЕ ЗАБУВАННЯ У ВАГАХ │
├─────────────────────────────────────────────────────────────┤
│ 1. СТАН МОДЕЛІ ПІСЛЯ PRE-TRAINING: │
│ Вміє писати на Python, знає історію, володіє англійською │
├─────────────────────────────────────────────────────────────┤
│ 2. АГРЕСИВНЕ ДОНАВЧАННЯ (Fine-Tuning без запобіжників): │
│ Моделі згодовують лише медичні висновки французькою │
│ ➔ Мільярди ваг переналаштовуються під нові слова │
├─────────────────────────────────────────────────────────────┤
│ 3. РЕЗУЛЬТАТ ЧЕРЕЗ 5 ГОДИН: │
│ ✅ Блискуче розбирається у французькій медицині │
│ ❌ ПОВНІСТЮ ЗЛАМАЛОСЯ програмування на Python! │
└─────────────────────────────────────────────────────────────┘
3. Як сучасні лабораторії рятують моделі від амнезії
- Заморожування ваг (LoRA / PEFT): базова модель взагалі не змінюється. Нові знання пишуться в окремий крихітний файл-адаптер збоку.
- Змішування датасетів (Replay Buffer): до нових уроків постійно підмішують старі завдання, щоб модель «повторювала пройдений матеріал».
- Штрафи за зміну важливих нейронів (Elastic Weight Consolidation): математика блокує зміну тих коефіцієнтів, які критично важливі для базової логіки.
4. Практичний висновок
Саме через катастрофічне забування створити повноцінний ШІ, який навчається на льоту в процесі кожної розмови з користувачем (Continual Learning), так важко. Натомість для збереження нової інформації використовують зовнішню пам'ять: контекстне вікно, векторні бази даних (RAG) та файли заміток.
FAQ: Катастрофічне забування (Catastrophic Forgetting)
Пов'язані терміни
Тонке донавчання (Fine-Tuning)
Процес адаптації вже навченої великої моделі до вузькоспеціалізованого завдання або стилю за допомогою невеликого якісного датасету (Supervised Fine-Tuning, SFT). Дозволяє навчити ШІ медичній термінології, корпоративному тону або форматуванню специфічного коду за кілька годин.
Перенавчання (Overfitting)
Фундаментальна проблема машинного навчання: модель надмірно підлаштовується під тренувальний датасет разом із його специфічним шумом, втрачаючи здатність до генералізації (Generalization) на нових даних. Розбір дивергенції функцій втрат, технік регуляризації та Early Stopping у коді.
Попереднє навчання (Pre-training)
Початковий етап створення базової великої мовної моделі (Foundation Model). Процес згодовування нейромережі трильйонів слів з інтернету, книг і коду на кластерах із тисяч відеокарт протягом місяців за десятки й сотні мільйонів доларів.