claude랑 ai 학습 시키면서 이것저것 물어보는데
한-영 번역을 어떻게 할수 있나 해서
위키피디아 영문/한글 두개 넣어서 돌리면 알아서 번역가능한거 아니냐 하니 그건또 아니라고 한다. ㅠㅠ
정확하게 매칭된 한 문장이 다른 분장으로 번역된 쌍이 필요한 것 이라고.
그럼 결국 기계번역도 수 많은 번역을 해온 자원봉사자들의 위에 우리가 혜택을 누리는건가..
| 한국어 위키의 "서울" 문서와 영어 위키의 "Seoul" 문서는 서로 번역이 아닙니다. 각각 별도의 저자들이 독립적으로 쓴 글이라, 분량도 다르고, 다루는 내용도 다르고, 문장 순서도 다릅니다. 두 코퍼스를 그냥 섞어서 "다음 토큰 맞추기"로 학습시키면, 모델은 "이 한국어 문단과 저 영어 문단이 같은 의미다"라는 신호를 전혀 받지 못합니다 — 그냥 같은 파라미터 공간 안에 두 개의 독립된 언어 능력이 나란히 쌓일 뿐이지, 둘을 잇는 다리가 저절로 생기지 않습니다. 지난번 "베이스 모델이 처음 보는 지식은 SFT로 못 만든다"는 얘기와 같은 원리가 여기도 적용됩니다 — 정렬(alignment) 신호가 없는 데이터는 아무리 섞어도 번역 능력을 만들지 않습니다. 실제로 이걸 해낸 방법이 있습니다 — WikiMatrix Meta(당시 Facebook AI)가 정확히 "위키백과에서 자동으로 문장 쌍을 뽑아내는" 문제를 풀었습니다: - LASER라는 다국어 문장 임베딩 모델로 93개 언어의 문장을 같은 벡터 공간에 투영 - 한국어 문장과 영어 문장의 벡터가 얼마나 가까운지(의미적으로 비슷한지) 계산해서, 진짜로 비슷한 뜻인 문장 쌍만 골라냄 - 이렇게 85개 언어에서 1억 3,500만 개 병렬 문장을 자동으로 채굴했고, 결과물이 공개돼 있습니다 즉 "위키 두 개를 그냥 넣는 것"과 "WikiMatrix식으로 의미 유사도를 계산해서 진짜 대응 문장만 골라내는 것" 사이엔 **완전히 다른 파이프라인 하나(문장 임베딩 모델 + 유사도 필터링)**가 끼어 있습니다. 다행히 이건 우리가 처음부터 만들 필요 없이, WikiMatrix가 이미 뽑아놓은 한영 병렬 문장 쌍을 가져다 쓰는 게 현실적입니다. 정리하면 ❌ 한국어 위키 + 영어 위키를 그냥 같이 넣기 → 두 언어를 "따로따로" 아는 모델은 될 수 있어도, 번역은 안 됨 ✅ WikiMatrix 같은 이미 정렬된 병렬 코퍼스를 사전학습/SFT에 넣기 → "이 한국어 문장 = 이 영어 문장"이라는 신호가 명시적으로 존재 |
'모종의 음모 > ai 프로그램' 카테고리의 다른 글
| diffusion gemma (0) | 2026.09.23 |
|---|---|
| 직접만든 LLM .. part 2 (0) | 2026.09.23 |
| 직접 LLM 만들...기? (0) | 2026.09.22 |
| llama-tokenize (0) | 2026.09.22 |
| llama-cli /clear (0) | 2026.09.22 |
