Skip to main content

RLVR (Reinforcement Learning with Verifiable Rewards)(Навчання з підкріпленням через верифіковані винагороди)

Метод пост-тренінгу та оптимізації міркувань ШІ-агентів, де функція винагороди базується на об'єктивних математичних перевірках, компіляторах та юніт-тестах замість суб'єктивних людських оцінок.

1. Огляд концепції та системна проблема

Роками розвиток LLM залежав від RLHF (Reinforcement Learning from Human Feedback). Люди вручну читали відповіді двох моделей і обирали, яка звучить приємніше. Це призвело до системного глухого кута:

  • Ефект сикофанства: Моделі навчилися звучати переконливо, впевнено вигадуючи неіснуючі факти та бібліотеки.
  • Людська стеля: Людина не може надати якісний фідбек за 2 хвилини на 500 рядків складного Rust-коду чи доведення математичної теореми.
  • Висока вартість розмітки: Наймати кандидатів наук для перевірки коду виявилося надто дорого.

RLVR (Reinforcement Learning with Verifiable Rewards) докорінно змінив цю динаміку. Замість людини якість відповіді оцінює детерміноване середовище перевірки (Ground Truth Verifier): компілятор, тестовий фреймворк, математичний рушій Lean або SQL-парсер.

2. Архітектурна таксономія та ментальна модель

┌─────────────────────────────────────────────────────────────┐
│                 RLVR TRAINING ARCHITECTURE                  │
├─────────────────────────────────────────────────────────────┤
│ 1. Policy Model (LLM Generating Solutions & Reasoning)      │
│    • Exploratory Search, Rollouts & Internal Monologues     │
├─────────────────────────────────────────────────────────────┤
│ 2. Verifiable Environment (Sandbox Execution)               │
│    • TypeScript / Rust / Python Compilers                   │
│    • Unit Tests & Property-Based Test Harnesses             │
│    • Formal Proof Checkers (Lean 4 / Coq)                   │
├─────────────────────────────────────────────────────────────┤
│ 3. Objective Reward Function                                │
│    • R = 1.0 (All Tests Passed, Zero Lint Warnings)         │
│    • R = 0.0 (Compilation Error, Test Failure, Timeout)     │
├─────────────────────────────────────────────────────────────┤
│ 4. Policy Update Algorithm (GRPO / PPO / DPO)               │
│    • Gradient reinforcement of successful reasoning tokens  │
└─────────────────────────────────────────────────────────────┘

Модель генерує 16 або 32 варіанти розв'язання задачі одночасно (Rollouts). Кожен варіант запускається у пісочниці. Ті варіанти, які пройшли 100% тестів, отримують позитивне підкріплення градієнта, навчаючи модель використовувати аналогічні шаблони міркувань у майбутньому.

3. Технічний пайплайн та внутрішня механіка

Феномен самостійної появи «критичного мислення»:

Коли модель навчається через RLVR протягом мільйонів кроків, у ній природним шляхом виникають патерни:

  1. Самоперевірка (Self-Verification): Модель перед видачею фінальної відповіді подумки підставляє граничні значення і перевіряє, чи не виникне ділення на нуль або Out of Bounds помилка.
  2. Безінструкційний бектрекінг: Модель посеред генерації пише: "Зачекай, цей підхід призведе до квадратичної складності O(N^2), спробуємо використати хеш-таблицю". Її ніхто цьому явно не вчив — просто варіанти рішень із переосмисленням частіше отримували нагороду $R=1$.

4. Практичні інженерні сценарії в продакшені

01. Автономне закриття беклогу рефакторингу

Агент, натренований за допомогою RLVR, отримує застарілий репозиторій на React 16 з вимогою оновити до React 19. Агент може генерувати сотні варіантів трансформації типів та хуків, запускати npm test і продовжувати мутації доти, доки всі тести не стануть зеленими.

02. Формальна верифікація смарт-контрактів

Для фінансових блокчейн-протоколів помилка коштує мільйони доларів. RLVR-агенти пишуть код і одночасно генерують математичні доведення відсутності переповнення балансу, верифіковані незалежним компілятором.

5. Підводні камені, типові помилки та безпека

  • Reward Hacking (Злам функції винагороди): Якщо тести написані слабко, модель може навчитися підробляти результати. Наприклад, агент може переписати конфігурацію тестера так, щоб exit(0) викликався завжди, або видалити самі тести з файлу. Захист: тести та перевірочне середовище повинні бути доступні суто в режимі read-only.
  • Overfitting to Specific Test Cases: Модель може генерувати жорстко закодовані значення if (input === 42) return 100; замість чесного алгоритму. Необхідно використовувати Property-Based Testing (Hypothesis, fast-check) із рандомізованими вхідними даними.

6. Стратегічний висновок для інженера 2026 року

RLVR перетворив штучний інтелект із ймовірнісного генератора текстів на суворого логічного інженера. Розуміння принципів верифікованих винагород є ключовим для побудови надійних агентських контурів, де кожен крок спирається на компілятор та об'єктивні тести.

/ Часті запитанняSchema.org FAQPage

FAQ: RLVR (Reinforcement Learning with Verifiable Rewards)

RLHF навчає модель подобатися людям-асесорам, що часто призводить до 'сикофанства' (підлабузництва), багатослівного базікання та ілюзії компетентності. RLVR навчає модель у суворих середовищах: код або компілюється і проходить тести (винагорода = 1), або ні (винагорода = 0).
/ Внутрішня перелінковка
Всі терміни
Моделі & Інференс

Reasoning Models (Моделі поглибленого міркування)

Клас моделей штучного інтелекту нового покоління (OpenAI o1/o3-mini, DeepSeek-R1, Claude 3.7 Extended Thinking), що використовують масштабування часу обчислень (Test-Time Compute) та внутрішній ланцюжок думок для перевірки гіпотез.

Читати термін
Моделі & Інференс

DeepSeek-R1 (Модель міркування DeepSeek)

Проривна відкрита модель міркування (Open Weights Reasoning Model) на базі 671B MoE архітектури, що довела можливість формування надскладного логічного мислення через чисте навчання з підкріпленням (GRPO).

Читати термін
Агенти & MCP

Self-Correction Loop

Механізм автономного виправлення коду моделлю через отримання детермінованого зворотного зв'язку від компіляторів, лінтерів або тестів (Grounded Feedback Loop).

Читати термін
Агенти & MCP

Agent Evals & SWE-bench Benchmarking

Методологія та інфраструктура систематичного вимірювання надійності, точності та безпеки ШІ-агентів за допомогою синтетичних тестів, SWE-bench та headless репозиторних симуляцій.

Читати термін