TCH MDA AI SA Sanket Thakur When RLVR Starts Cheating: Lessons from Long-Horizon GRPO Training on GSM8K I kept training an RLVR model long enough … and discovered a new language.
AI TCH VE VectorWorks Academy The Benchmark Trap: Why AI Agents Look Ready Until You Test Them Like Products AI agents are having their “show me” moment.