Find a story
Search Spins
Search titles, summaries, and missing voices across published articles — press releases, announcements, and media coverage.
0 results for “verifiable rewards”
SLPO: Scaling Latent Reasoning via a Surrogate Policy
Researchers propose SLPO, a new reinforcement learning method to enable outcome-reward optimization in latent reasoning models—addressing key limitations that previously prevented test-time scaling in continuous-vector-based reasoning systems.
Jul 23, 2026
PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization
A new reinforcement learning framework called PPO-HSC is introduced to mitigate mode collapse in LLM fine-tuning by incentivizing semantic novelty while preserving solution validity.
Jul 21, 2026
Verifiable Rewards for Calibrated Probabilistic Forecasting
Researchers propose a new approach to verifiable rewards for calibrated probabilistic forecasting in reinforcement learning.
Published Jul 2, 2026 · Analyzed Jul 5, 2026