How DSpark Speeds Up LLM Inference by Deciding What Not to Verify
DeepSeek and Peking University’s open speculative-decoding stack: 60–85% faster per user on V4, with drafters you can train for your own models