gpu가 2개다 보니
기본값으로 반띵하면 이상하게 gpu0번에 메모리가 부족하고 gpu1번에는 1기가 넘게 남고 그러다 보니
그 비율을 조절해서 gpu1에 조금더 할당할 방법이 없나 해서 찾는 중
| llama-b10145$ ./llama-cli --help | grep tensor-split -ts, --tensor-split N0,N1,N2,... fraction of the model to offload to each GPU, comma-separated list of |
'프로그램 사용 > ai 프로그램' 카테고리의 다른 글
| llama.cpp / 1080 ti 11GB * 2 / Qwen3.6-35B Q2, MXFP4 (0) | 2026.07.30 |
|---|---|
| llama.cpp / 1080 ti 11GB * 2/ gemma4-31B (0) | 2026.07.30 |
| llama.cpp / jetson thor gemma-4-31B mmproj F16, BF16 (0) | 2026.07.30 |
| llama.cpp 동시에 응답하게 하기 (0) | 2026.07.29 |
| vllm concurrent test/benchmark (0) | 2026.07.29 |
