Strata: The Inference Engine That Runs a 125B MoE Like a Memory Cache
How a C++ and CUDA engine turns expert routing, graph capture, and aggressive quantization into a practical way to run server-class models on consumer GPUs.
10 min read ยท Sep 30, 2026