--tensor-parallel-size | 1 | Number of GPUs to shard the model across. |
--max-model-len | 262144 | Maximum context length (tokens) the server accepts per request. |
--kv-cache-dtype | fp8 | KV cache numeric precision. fp8: ~2× KV cache density with negligible quality impact on most models. |
--gpu-memory-utilization | 0.90 | Fraction of GPU memory vLLM may use for weights and KV cache. |
--max-num-seqs | 64 | Maximum number of concurrent sequences in the batch. |
--enable-prefix-caching | (no value) | Reuse KV cache across requests that share a prefix. |
--limit-mm-per-prompt.image | 1 | Maximum number of image inputs per prompt. |
--mm-encoder-tp-mode | data | Tensor-parallel mode for the multimodal vision encoder. data: Data-parallel encoding; each rank processes different images independently. |
--reasoning-parser | qwen3 | Server-side parser that separates reasoning output into reasoning_content. qwen3: Qwen3-family thinking format (used by Qwen3, Qwen3.5, and Qwen3.6). |
--enable-auto-tool-choice | (no value) | Let the model choose when to call tools without requiring tool_choice: "required". |
--tool-call-parser | qwen3_coder | Server-side parser that emits structured tool_calls on the response. qwen3_coder: Qwen3-Coder tool format. |
--speculative-config.method | mtp | Speculative decoding method. mtp: Multi-token prediction head speculation. |
--speculative-config.num_speculative_tokens | 3 | Number of tokens the draft speculator proposes per step. |
--kv-transfer-config.kv_connector | SimpleCPUOffloadConnector | KV cache transfer connector for offloading cache to host memory or another node. SimpleCPUOffloadConnector: Offloads KV cache to CPU memory to extend the effective KV cache capacity beyond GPU memory. |
--kv-transfer-config.kv_role | kv_both | Role this node plays in KV cache transfer. kv_both: Both sender and receiver, used for single-node CPU offload. |
--kv-transfer-config.kv_connector_extra_config.cpu_bytes_to_use_per_rank | 68719476736 | Bytes of CPU memory allocated per rank for KV cache offload. |
--kv-transfer-config.kv_connector_extra_config.lazy_offload | false | Whether to offload KV cache lazily (on demand) or eagerly. false: Eager offload; KV cache is copied to CPU memory as soon as it is produced. |