어우 도대체 프론티어 모델들을 돌리는 데이터는 얼마나 어마어마하게 쌓여있어야 하고
얼마나 대단한 컴퓨팅 파워를 필요로 하는걸까?
대답은 이 난리가 나고 있다.
| /mnt/llm-ko/3_small/gguf$ /mnt/Downloads/llama-b10488/llama-cli -m base42m-it-q4_0.gguf Loading model... ▄▄ ▄▄ ██ ██ ██ ██ ▀▀█▄ ███▄███▄ ▀▀█▄ ▄████ ████▄ ████▄ ██ ██ ▄█▀██ ██ ██ ██ ▄█▀██ ██ ██ ██ ██ ██ ██ ██ ▀█▄██ ██ ██ ██ ▀█▄██ ██ ▀████ ████▀ ████▀ ██ ██ ▀▀ ▀▀ build : b10488-9d77fa172 model : base42m-it-q4_0.gguf ftype : Q4_0 modalities : text available commands: /exit or Ctrl+C stop or exit /regen regenerate the last response /clear clear the chat history /read <file> add a text file /glob <pattern> add text files using globbing pattern > 안녕? 죄송해요, 저는 실시간 검색은 할 수 없어요. 제가 알기 어려워요 [ Prompt: 745.2 t/s | Generation: 868.1 t/s ] > 서울은 어디야? 서울은 부산입니다 [ Prompt: 2201.1 t/s | Generation: 719.6 t/s ] > 대한민국 수도는? 서울이에요 [ Prompt: 888.6 t/s | Generation: 543.7 t/s ] > 서울이 먼데? 서울은 서울이에요 [ Prompt: 648.3 t/s | Generation: 268.8 t/s ] > 넌 누구야? 서울이에요 [ Prompt: 420.3 t/s | Generation: 172.6 t/s ] > 마이크로소프트는? Microsoft Windows에서 작동하지만, 지금은 그 기능이 이전 버전에서는 작동하지 않는다. 서울은 부산입니다학과를 졸업하고 서울에 입사한 이력이 있는 강사는 김용수(金容洙), 김용수(金容洙), 김용원(金容元)이에요 [ Prompt: 255.9 t/s | Generation: 158.8 t/s ] > python 예제 요 [ Prompt: 460.2 t/s | Generation: 113.4 t/s ] > golang 예제 많으셨어요? [ Prompt: 234.1 t/s | Generation: 164.8 t/s ] > 많겠냐구요 많으셨어요 [ Prompt: 358.2 t/s | Generation: 162.3 t/s ] > 아니이~ 안녕하세요~ 너무 편하게 물어보세요 [ Prompt: 244.9 t/s | Generation: 138.8 t/s ] > 안편하다고 보통 대화할 때가 되자요 [ Prompt: 349.4 t/s | Generation: 163.6 t/s ] > 전화줘 처음 대화하는 시간을 줄이거나 대화하는 시간을 줄인 편하게 물어보세요 [ Prompt: 317.0 t/s | Generation: 152.1 t/s ] > 안편한데? 질문에 대답하지 마세요 [ Prompt: 544.9 t/s | Generation: 149.4 t/s ] > 야이 더 쉽게 대화할 수 있어요, 더 잘 보셨나요? [ Prompt: 267.9 t/s | Generation: 140.7 t/s ] |
대충 9 epoch / 23118 스텝 학습
| ┌───────────────┬─────────────────────────────────────────────────────┐ │ │ │ ├───────────────┼─────────────────────────────────────────────────────┤ │ base 사전학습 │ 23,118스텝, 실제 9.42 epoch, val loss 3.4899(ppl 32.8) │ ├───────────────┼─────────────────────────────────────────────────────┤ │ SFT │ 176스텝(206개 예시), 최고 val loss 2.5465 │ ├───────────────┼─────────────────────────────────────────────────────┤ │ GGUF │ base/it × f32/q4_0 총 4개 파일 모두 3_small/gguf/에 준비 완료 │ └───────────────┴─────────────────────────────────────────────────────┘ ┌─────────────────────┬──────────────────────┬──────────────────────────────┐ │ 데이터 │ 용도 │ 규모 │ ├─────────────────────┼──────────────────────┼──────────────────────────────┤ │ 한국어 위키백과 │ 사전학습 본문 │ 문서 676,120개, 문단 316만개, 글자 5.58억자 │ ├─────────────────────┼──────────────────────┼──────────────────────────────┤ │ 국립국어원 사전 3종 │ 토크나이저 어휘 시드 │ 뜻풀이 101만 줄, 표제어 32.6만 줄 │ ├─────────────────────┼──────────────────────┼──────────────────────────────┤ │ 직접 작성 대화 예시 │ SFT(대화 형식) │ 206개 │ └─────────────────────┴──────────────────────┴──────────────────────────────┘ ┌───────┬─────────┬───────────┬───────────────────────┐ │ │ 문서 │ 문단 │ 토큰 │ ├───────┼─────────┼───────────┼───────────────────────┤ │ train │ 672,731 │ 3,144,350 │ 243,428,930 (2.434억) │ ├───────┼─────────┼───────────┼───────────────────────┤ │ val │ 3,389 │ 16,372 │ 1,250,690 │ └───────┴─────────┴───────────┴───────────────────────┘ v1 최종 학습량: 약 22.9억 토큰 (2.434억 × 9.42 epoch) 모델 - 42.3M 파라미터 (8층, 512차원), fp32 - 임베딩(16.6M)이 전체의 약 39% 차지 SFT - 206개 대화 예시(직접 작성, 라이선스 깨끗함), 최종 176스텝(약 8 epoch) 학습 요약하면: 실제 원본 텍스트는 위키 5.58억자를 2.434억 토큰으로 압축해서 갖고 있고, 학습 때는 그걸 약 9.4번 반복해서 총 22.9억 토큰어치를 모델에 흘려보낸 셈입니다. |
| -rw-rw-r-- 1 minimonk minimonk 163M 9월 23 14:50 base42m-f32.gguf -rw-rw-r-- 1 minimonk minimonk 163M 9월 23 14:51 base42m-it-f32.gguf -rw-rw-r-- 1 minimonk minimonk 28M 9월 23 14:51 base42m-it-q4_0.gguf -rw-rw-r-- 1 minimonk minimonk 28M 9월 23 14:50 base42m-q4_0.gguf |
'모종의 음모 > ai 프로그램' 카테고리의 다른 글
| diffusion gemma 실행해보기 (0) | 2026.09.24 |
|---|---|
| diffusion gemma (0) | 2026.09.23 |
| wikimatrix (0) | 2026.09.22 |
| 직접 LLM 만들...기? (0) | 2026.09.22 |
| llama-tokenize (0) | 2026.09.22 |
