Skip to main content

Катастрофическое забывание (Catastrophic Forgetting)

Фундаментальная проблема искусственных нейронных сетей, когда при обучении новой задаче или на другом языке обновленные весовые коэффициенты перезаписывают предыдущие связи, приводя к внезапной и полной утрате ранее приобретенных навыков.

1. Обзор концепции и системная проблема

Представьте шахматиста-гроссмейстера, который решил научиться играть в теннис. Он берет ракетку, тренируется месяц, выходит на корт... но когда возвращается к шахматной доске, вдруг обнаруживает, что вообще не помнит, как ходит конь или пешка.

Для человека это звучит абсурдно. Но для искусственных нейросетей это суровая инженерная реальность.

Катастрофическое забывание (Catastrophic Forgetting) — это явление, когда новые знания буквально вытесняют и стирают старые:

  • Все знания модели — это единое полотно взаимосвязанных чисел (весов).
  • Когда вы обучаете модель новой задаче, алгоритм корректирует эти числа.
  • Обновление под новую задачу может разрушить тонкие настройки, которые отвечали за другую навык.

Суть концепции проста: напоминание: нельзя просто «докинуть файл» в веса модели без риска сломать ее предыдущий разум.

2. Как новые знания стирают старые

┌─────────────────────────────────────────────────────────────┐
│                 КАТАСТРОФИЧЕСКОЕ ЗАБУВАНИЕ В ВЕСАХ          │
├─────────────────────────────────────────────────────────────┤
│ 1. СОСТОЯНИЕ МОДЕЛИ ПОСЛЕ PRE-TRAINING:                     │
│    Умеет писать на Python, знает историю, владеет английским │
├─────────────────────────────────────────────────────────────┤
│ 2. АГРЕССИВНОЕ ДОУЧЕНИЕ (Fine-Tuning без предохранителей):  │
│    Модели кормят только медицинскими выводами на французском │
│    ➔ Миллиарды весов перенастраиваются под новые слова      │
├─────────────────────────────────────────────────────────────┤
│ 3. РЕЗУЛЬТАТ ЧЕРЕЗ 5 ЧАСОВ:                                │
│    ✅ Блестяще разбирается во французской медицине          │
│    ❌ ПОЛНОСТЬЮ СЛОМАЛОСЬ программирование на Python!       │
└─────────────────────────────────────────────────────────────┘

3. Как современные лаборатории спасают модели от амнезии

  1. Замораживание весов (LoRA / PEFT): базовая модель вообще не изменяется. Новые знания записываются в отдельный крошечный файл-адаптер сбоку.
  2. Смешивание датасетов (Replay Buffer): к новым урокам постоянно подмешивают старые задания, чтобы модель «повторяла пройденный материал».
  3. Штрафы за изменение важных нейронов (Elastic Weight Consolidation): математика блокирует изменение тех коэффициентов, которые критически важны для базовой логики.

4. Практические инженерные сценарии в продакшене

01. Обучение модели на медицинских текстах

02. Использование метода LoRA для дообучения

03. Применение смешивания данных для предотвращения забывания

5. Подводные камни, типовые ошибки и безопасность

При работе с катастрофическим забыванием важно помнить о рисках, связанных с изменением весов. Неправильное применение методов Fine-Tuning может привести к полной утрате функциональности модели в других областях.

/ Частые вопросыSchema.org FAQPage

FAQ: Катастрофическое забывание (Catastrophic Forgetting)

Мозг человека обладает сложной многоуровневой пластичностью: у нас есть гиппокамп для быстрого временного запоминания и кора головного мозга для долговременной памяти. Изучая испанский язык, вы не забываете внезапно родной язык или умение кататься на велосипеде.
/ Внутренняя перелинковка
Все термины
Модели и Инференс

Тонкое дообучение (Fine-Tuning)

Процесс адаптации уже обученной большой модели к узкоспециализированной задаче или стилю с помощью небольшого качественного датасета (Supervised Fine-Tuning, SFT). Позволяет обучить ИИ медицинской терминологии, корпоративному тону или форматированию специфического кода за несколько часов.

Читать термин
Модели и Инференс

Переобучение (Overfitting)

Фундаментальная проблема машинного обучения: модель чрезмерно подстраивается под тренировочный датасет вместе с его специфическим шумом, теряя способность к генерализации (Generalization) на новых данных. Анализ дивергенции функций потерь, техник регуляризации и Early Stopping в коде.

Читать термин
Модели и Инференс

Предварительное обучение (Pre-training)

Начальный этап создания базовой большой языковой модели (Foundation Model). Процесс подачи нейросети триллионов слов из интернета, книг и кода на кластерах с тысячами видеокарт в течение месяцев за десятки и сотни миллионов долларов.

Читать термин