← Back to list

Lagniappe #55: RLVR

RLVR, sau Reinforcement Learning with Verifiable Rewards (Învățare prin întărire din recompense verificabile), reprezintă următoarea…

Ciprian Ghetau · 2026-02-19 06:24 · 0 claps · 1.6 min read
#ai-agent #ai #rlvr #llm
Open on Medium ↗
Wiki topics: LLM · Large Language Models AGT · AI Agents ML · Machine Learning AI · AI · General EDU · Education & Learning 🎮 · Gaming

Lagniappe #55: RLVR

RLVR, sau Reinforcement Learning with Verifiable Rewards (Învățare prin întărire din recompense verificabile), reprezintă următoarea evoluție majoră după RLHF în post-training-ul modelelor de limbaj mari (LLM-uri). Spre deosebire de preferințele subiective umane, RLVR folosește recompense obiective și automate, determinate de verificatori/verifiers programatici care verifică corectitudinea output-ului — fie final, fie raționamentul pas cu pas.

Procesul pornește de la un model pre-antrenat (sau SFT-uit), apoi intră în bucla de reinforcement learning:

  1. Modelul generează multiple completări (sampling).
  2. Fiecare output trece prin un verifier deterministic: ex. rulează codul și verifică dacă trece testele unitare, execută expresia matematică și compară cu răspunsul corect, verifică formatul (ex. \boxed{} pentru MATH), sau evaluează dacă raționamentul Chain-of-Thought duce la soluția corectă.
  3. Recompensa este binară sau scalată (de obicei 0/1, sau normalizată): +1 dacă verificarea trece, 0/-1 altfel.
  4. Se optimizează politica folosind algoritmi ca PPO, GRPO (Group Relative Policy Optimization) sau variante, care sunt mai stabile și scalabile decât clasicul PPO, evitând nevoia unui reward model învățat explicit.

Rezultatul: modelul învață să maximizeze probabilitatea căilor care duc la output-uri verificabil corecte, comprimând search-ul intern și îmbunătățind pass@1 dramatic.

RLVR excelează în domenii unde corectitudinea poate fi verificată obiectiv: matematică (GSM8K, MATH), coding (HumanEval, SWE-Bench), SQL/query execution, știință (simulări fizice, biologie computațională), agenți software și tool use. A permis modelelor open-source să atingă performanțe de top pe benchmark-uri de reasoning, uneori depășind modele mai mari prin simpla optimizare a corectitudinii. În enterprise, RLVR crește fiabilitatea, reduce halucinațiile și face AI-ul potrivit pentru workflow-uri agentice unde erorile sunt costisitoare. Spre deosebire de RLHF (care aliniază „vibe-ul” — ton, siguranță, politețe), RLVR aliniază la adevăr verificabil, fiind ideal pentru reasoning complex și autonomie.

Deși puternic, RLVR nu e magic: pe unele modele (ex. Qwen2.5-Math) poate îmbunătăți performanța chiar și cu recompense spurious (random, format-only), sugerând că „deblochează” raționament latent din pre-training mai degrabă decât creează capabilități noi. Verifierii imperfecti (false positives/negatives) pot încetini convergența sau induce reward hacking, mai ales în coding unde testele sunt sparse. Extensii ca RLVRR (reference-based) sau handling noisy verifiers apar rapid. Costul e mult mai mic decât RLHF (fără labeling uman masiv), permițând scaling masiv.

Totuși, rămâne limitat la domenii verificabile; pentru task-uri open-ended (eseuri lungi, creative) hibride cu RLHF sau noi metode (ex. JEPO) sunt necesare. În final, RLVR marchează trecerea de la aliniere subiectivă la aliniere obiectivă — fundația reasoning-ului scalabil și a agenților de încredere.


메타데이터
post_id
31fd4d3f63aa
slug
lagniappe-55-rlvr-31fd4d3f63aa
url
https://medium.com/@ciprianghetau/lagniappe-55-rlvr-31fd4d3f63aa
canonical_url
https://medium.com/@ciprianghetau/lagniappe-55-rlvr-31fd4d3f63aa
author_url
https://medium.com/@ciprianghetau
status
ok
fetched_at
2026-06-21 07:44:09