Lagniappe #55: RLVR
RLVR, sau Reinforcement Learning with Verifiable Rewards (Învățare prin întărire din recompense verificabile), reprezintă următoarea…
Lagniappe #55: RLVR
RLVR, sau Reinforcement Learning with Verifiable Rewards (Învățare prin întărire din recompense verificabile), reprezintă următoarea evoluție majoră după RLHF în post-training-ul modelelor de limbaj mari (LLM-uri). Spre deosebire de preferințele subiective umane, RLVR folosește recompense obiective și automate, determinate de verificatori/verifiers programatici care verifică corectitudinea output-ului — fie final, fie raționamentul pas cu pas.
Procesul pornește de la un model pre-antrenat (sau SFT-uit), apoi intră în bucla de reinforcement learning:
- Modelul generează multiple completări (sampling).
- Fiecare output trece prin un verifier deterministic: ex. rulează codul și verifică dacă trece testele unitare, execută expresia matematică și compară cu răspunsul corect, verifică formatul (ex. \boxed{} pentru MATH), sau evaluează dacă raționamentul Chain-of-Thought duce la soluția corectă.
- Recompensa este binară sau scalată (de obicei 0/1, sau normalizată): +1 dacă verificarea trece, 0/-1 altfel.
- Se optimizează politica folosind algoritmi ca PPO, GRPO (Group Relative Policy Optimization) sau variante, care sunt mai stabile și scalabile decât clasicul PPO, evitând nevoia unui reward model învățat explicit.
Rezultatul: modelul învață să maximizeze probabilitatea căilor care duc la output-uri verificabil corecte, comprimând search-ul intern și îmbunătățind pass@1 dramatic.
RLVR excelează în domenii unde corectitudinea poate fi verificată obiectiv: matematică (GSM8K, MATH), coding (HumanEval, SWE-Bench), SQL/query execution, știință (simulări fizice, biologie computațională), agenți software și tool use. A permis modelelor open-source să atingă performanțe de top pe benchmark-uri de reasoning, uneori depășind modele mai mari prin simpla optimizare a corectitudinii. În enterprise, RLVR crește fiabilitatea, reduce halucinațiile și face AI-ul potrivit pentru workflow-uri agentice unde erorile sunt costisitoare. Spre deosebire de RLHF (care aliniază „vibe-ul” — ton, siguranță, politețe), RLVR aliniază la adevăr verificabil, fiind ideal pentru reasoning complex și autonomie.
Deși puternic, RLVR nu e magic: pe unele modele (ex. Qwen2.5-Math) poate îmbunătăți performanța chiar și cu recompense spurious (random, format-only), sugerând că „deblochează” raționament latent din pre-training mai degrabă decât creează capabilități noi. Verifierii imperfecti (false positives/negatives) pot încetini convergența sau induce reward hacking, mai ales în coding unde testele sunt sparse. Extensii ca RLVRR (reference-based) sau handling noisy verifiers apar rapid. Costul e mult mai mic decât RLHF (fără labeling uman masiv), permițând scaling masiv.
Totuși, rămâne limitat la domenii verificabile; pentru task-uri open-ended (eseuri lungi, creative) hibride cu RLHF sau noi metode (ex. JEPO) sunt necesare. În final, RLVR marchează trecerea de la aliniere subiectivă la aliniere obiectivă — fundația reasoning-ului scalabil și a agenților de încredere.
메타데이터
- post_id
- 31fd4d3f63aa
- slug
- lagniappe-55-rlvr-31fd4d3f63aa
- url
- https://medium.com/@ciprianghetau/lagniappe-55-rlvr-31fd4d3f63aa
- canonical_url
- https://medium.com/@ciprianghetau/lagniappe-55-rlvr-31fd4d3f63aa
- author_url
- https://medium.com/@ciprianghetau
- status
- ok
- fetched_at
- 2026-06-21 07:44:09