Закони масштабування ШІ (Scaling Laws)(Scaling Laws: математичне правило, заради якого у ШІ вливають сотні мільярдів доларів)
Емпіричний закон OpenAI та Google (сформульований Джаредом Капланом у 2020 році), який стверджує: продуктивність мовної моделі передбачувано зростає як степеневий закон при збільшенні трьох факторів: кількості параметрів моделі, обсягу тренувальних даних та витраченої обчислювальної потужності (Compute).
1. Огляд концепції та призначення
У 2020 році дослідник Джаред Каплан разом із командою OpenAI опублікував відкриття, яке назавжди змінило технологічну історію світу.
Вони з'ясували, що штучний інтелект підкоряється надзвичайно чітким законам математики, подібним до законів гравітації у фізиці:
- Якщо ви зробите модель у 10 разів більшою і дасте їй у 10 разів більше книг — її помилка зменшиться строго за математичною формулою.
- Ніяких випадковостей чи «магії»: більше заліза + більше даних = гарантовано розумніший інтелект.
Цей закон отримав назву Scaling Laws (Закони масштабування). Саме тому Microsoft, Google, Meta та Amazon почали будувати гігантські дата-центри вартістю сотні мільярдів доларів.
З практичної точки зору це відповідь на питання: чому нова модель завжди розумніша за стару.
2. Три кити масштабування
┌─────────────────────────────────────────────────────────────┐
│ РІВНЯННЯ СКАЙЛІНГУ ДЖАРЕДА КАПЛАНА │
├─────────────────────────────────────────────────────────────┤
│ ПОМИЛКА МОДЕЛІ ЗМЕНШУЄТЬСЯ СТЕПЕНЕВО ВІД: │
│ │
│ 1. [ N ] Кількість параметрів (мозок моделі) │
│ 7B ➔ 70B ➔ 400B параметрів │
│ │
│ 2. [ D ] Обсяг даних для читання │
│ 1 трильйон ➔ 15 трильйонів токенів │
│ │
│ 3. [ C ] Кількість обчислень (відеокарти Nvidia) │
│ 1 000 GPU ➔ 100 000 суперчипів │
│ │
│ 📉 Результат: Пряма лінія зростання інтелекту на графіку! │
└─────────────────────────────────────────────────────────────┘
3. Нова ера: масштабування під час міркувань (Inference Scaling)
Коли відкритий інтернет закінчився, лабораторії відкрили друге дихання законів масштабування: Test-Time Scaling (масштабування часу роздумів):
- Якщо дозволити моделі «подумати» перед відповіддю не 1 секунду, а 30 секунд (згенерувати приховані ланцюжки перевірок), її здатність розв'язувати складні завдання з математики та програмування зростає так само передбачувано!
4. Практичний висновок
Поки діють закони масштабування, можливості штучного інтелекту продовжуватимуть стрімко зростати щороку. Те, що сьогодні здається нездійсненною науковою фантастикою, через одне-два покоління масштабування стане буденною функцією у вашому телефоні.
FAQ: Закони масштабування ШІ (Scaling Laws)
Пов'язані терміни
Попереднє навчання (Pre-training)
Початковий етап створення базової великої мовної моделі (Foundation Model). Процес згодовування нейромережі трильйонів слів з інтернету, книг і коду на кластерах із тисяч відеокарт протягом місяців за десятки й сотні мільйонів доларів.
Загальний штучний інтелект (AGI)
Штучний загальний інтелект (Artificial General Intelligence) — гіпотетична автономна система, здатна розуміти, навчатися та виконувати будь-яку інтелектуальну задачу на рівні людини або перевершувати її в більшості економічно цінних галузей праці.
Кількість параметрів моделі (7B, 14B, 70B)
Позначення загальної кількості навчальних параметрів (ваг) у великій мовній моделі, де буква 'B' означає мільярди (Billion). Головний показник інтелектуальної місткості моделі, швидкості її роботи та вимог до обсягу пам'яті комп'ютера.