Benchmarks & Evalrl-razor-mnist: How a Tiny Task Flag Reveals Why RL Forgets Less
A minimal replication of Sakana AI’s RL’s Razor experiment, where a single extra input bit, a KL-minimal oracle, and group-relative RL turn catastrophic forgetting into something you can inspect, compare, and predict.
8 min read