Published: April 22, 2025
1
19
80
ggufのローカル推論するなら、vLLMのtensor parallelが圧倒的に速い! Llama-3.3-Swallow-70B-IQ4_XS.gguf 左 vLLM tensor parallel 4 42 tokens/s 右 llama.cpp 14 tokens/s
ggufのローカル推論するなら、vLLMのtensor parallelが圧倒的に速い! Llama-3.3-Swallow-70B-IQ4_XS.gguf 左 vLLM tensor parallel 4 42 tokens/s 右 llama.cpp 14 tokens/s