We are using tiny models like granite 1b and no matter what settings pass it eventually eats all the server ram.
example
cat /proc/$(pgrep -f llama-server | head -n1)/cmdline | xargs -0 echo
/app/llama-server -ngl 999 --metrics --model /models/bundles/sha256/91eb206d6605bbeb033ea32d68e9ebb180539f2dd6bdff0d6e4e967ea15f5ace/model/model.gguf --host inference-runner-0.sock --ctx-size 2048 --parallel 2 --threads 5 --mlock --jinja
settings example
docker model configure --context-size 2048 granite-4.0-h-nano:1B -- --parallel 2 --threads 6 --mlock
We are using tiny models like granite 1b and no matter what settings pass it eventually eats all the server ram.
example
settings example