우옹.. 이런 걸 허용하다니

 

ollama를 기준으로 설명된게 많은데

[링크 : https://wikidocs.net/334911]

[링크 : https://yscho03.tistory.com/349]

 

올해 1월에 이미 anthropic api를 지원했다고

아니.. 내가 4월 부터 해봤는데 그 이전에 이미 지원했었다니.. 세상에!

llama-server -hf unsloth/Qwen3-Next-80B-A3B-Instruct-GGUF:Q4_K_M

# Run Claude Code with local endpoint
ANTHROPIC_BASE_URL=http://127.0.0.1:8080 claude

[링크 : https://huggingface.co/blog/ggml-org/anthropic-messages-api-in-llamacpp]

 

내가 회사에 두고 있는 local LLM 서버 아이피/포트에 --model 옵션으로 해서 지정해주면 되는것 같다.

$ ANTHROPIC_BASE_URL="http://192.168.40.238:8080" claude --model gemma4-e4b

 

 인사도 시켜보고, 이것저것 해보는데 내용 퀄리티 까지 본건 아니라서 모르겠지만 일단 작동은 한다.

 

 

웃긴건.. 회사 계정이라서 claude pro  결제 중인데, 그 사용량이 나온다는거.

그냥 출력 안되게 막아야 하지 않나? 모델 선정된 것에 따라 띄워야지..

 

그나저나 클로드 처음켜고 인사하던가 먼가 말을 하면 처음 보내는 프롬프트의 길이가 미친것 같다.

 

1562 line

19691 word

151492 bytes

이쁘게 꾸며진거라 라인수가 길긴 하겠지만, 단어수 대충 20k 흐음..

$ wc claude.tt 
  1562  19691 151492 claude.tt

$ wc -c claude.tt 
151492 claude.tt

$ wc -m claude.tt 
150916 claude.tt

$ wc -l claude.tt 
1562 claude.tt

$ wc -w claude.tt 
19691 claude.tt

 

그나마 내꺼에서 돌려볼만한게 gemma4-e4b인데 이걸로도 너무 느려서

역시 돈주고 쓰는게 싸다는 결론이.. 크흡

 

+

응답 시간이 서버에 맞춰져 있어서 2분 30초 넘으면 타임아웃 나는지 바보가 된다.

local LLM의 컨텍스트와 속도가 받혀줘야 쓸수 있을 듯.

 

최초 기동시 20k 정도 날리는데 클로드의 설정과 기능에 대한 프롬프트를 던져서 엄청 오래 걸리고

그 이후로도 제법 적지 않은 크기의 명령을 꾸준히 날린다.

'프로그램 사용 > ai 프로그램' 카테고리의 다른 글

Qwen3.8-27B-UD-IQ2_XXS / 1080ti 11GB  (0) 2026.08.19
lambda.ai gpu 클라우드  (0) 2026.08.11
elice cloud - gpu / npu 클라우드  (0) 2026.08.11
mediapipe / mmpose  (0) 2026.08.11
runpod.. 재조사  (0) 2026.08.11
Posted by 구차니