speculative-decoding

Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing latency for real-time applications, or deploying models with limited compute. Covers draft models, tree-based attention, Jac

By orchestra-research · 766 installs

npx skills add orchestra-research/ai-research-skills --skill speculative-decoding

Source repository · Upstream listing