Published: April 22, 2025
1
19
80

ggufのローカル推論するなら、vLLMのtensor parallelが圧倒的に速い! Llama-3.3-Swallow-70B-IQ4_XS.gguf 左 vLLM tensor parallel 4   42 tokens/s 右 llama.cpp 14 tokens/s

Share this thread

Read on Twitter

View original thread

Navigate thread

1/1