음.. 구형 하드웨어라 Q2가 오히려 성능이 잘나오는군..
| $ ../../llama-b9692/llama-cli -m Qwen3.6-35B-A3B-UD-Q2_K_XL.gguf > 안녕? [ Prompt: 9.4 t/s | Generation: 58.1 t/s ] > 너에 대해서 설명해줘 [ Prompt: 63.8 t/s | Generation: 58.1 t/s ] > 파이썬으로 셀레니움을 통해 웹을 서칭하고 텍스트만 추출하고 makrdown 으로 변환후 md 파일과 pdf로 저장하는 기능을 구현해줘 [ Prompt: 34.2 t/s | Generation: 56.4 t/s ] $ ../../llama-b9692/llama-cli -m Qwen3Qwen3.6-35B-A3B-MXFP4_MOE.gguf > 안녕? [ Prompt: 9.5 t/s | Generation: 48.6 t/s ] > 너에 대해서 설명해줘 [ Prompt: 43.4 t/s | Generation: 50.0 t/s ] > 파이썬으로 셀레니움을 통해 웹을 서칭하고 텍스트만 추출하고 makrdown 으로 변환후 md 파일과 pdf로 저장하는 기능을 구현해줘 [ Prompt: 77.6 t/s | Generation: 50.8 t/s ] |
'프로그램 사용 > ai 프로그램' 카테고리의 다른 글
| llama.cpp -ts 옵션 (0) | 2026.07.30 |
|---|---|
| llama.cpp / 1080 ti 11GB * 2/ gemma4-31B (0) | 2026.07.30 |
| llama.cpp / jetson thor gemma-4-31B mmproj F16, BF16 (0) | 2026.07.30 |
| llama.cpp 동시에 응답하게 하기 (0) | 2026.07.29 |
| vllm concurrent test/benchmark (0) | 2026.07.29 |
