LLM speculative inference server for heterogeneous hardware & consumer GPUs
C++2,893 stars283 forksApache-2.0 cudacuda-kernelsdflashheterogeneous-computingkernelllama-cpplocal-ailucemegakernelpflashpoolsideqwenr9700rocmrtx3090sparkspeculative-decodingspeculative-prefillstrix-halo