doc: update n-gpu-layers to show correct GPU usage

2024-01-27 11:53:49 -06:00 · 2024-01-27 11:53:49 -06:00 · 7298e97947
commit 7298e97947
parent 5e498be648
1 changed files with 1 additions and 1 deletions
--- a/examples/server/README.md
+++ b/examples/server/README.md
@ -70,7 +70,7 @@ You can consume the endpoints with Postman or NodeJS with axios library. You can
 docker run -p 8080:8080 -v /path/to/models:/models ggerganov/llama.cpp:server -m models/7B/ggml-model.gguf -c 512 --host 0.0.0.0 --port 8080

 # or, with CUDA:
-docker run -p 8080:8080 -v /path/to/models:/models --gpus all ggerganov/llama.cpp:server -m models/7B/ggml-model.gguf -c 512 --host 0.0.0.0 --port 8080 --n-gpu-layers 1
+docker run -p 8080:8080 -v /path/to/models:/models --gpus all ggerganov/llama.cpp:server -m models/7B/ggml-model.gguf -c 512 --host 0.0.0.0 --port 8080 --n-gpu-layers 99
 ```

 ## Testing with CURL