claude랑 ai 학습 시키면서 이것저것 물어보는데

한-영 번역을 어떻게 할수 있나 해서

위키피디아 영문/한글 두개 넣어서 돌리면 알아서 번역가능한거 아니냐 하니 그건또 아니라고 한다. ㅠㅠ

정확하게 매칭된 한 문장이 다른 분장으로 번역된 쌍이 필요한 것 이라고.

 

그럼 결국 기계번역도 수 많은 번역을 해온 자원봉사자들의 위에 우리가 혜택을 누리는건가..

  한국어 위키의 "서울" 문서와 영어 위키의 "Seoul" 문서는 서로 번역이 아닙니다. 각각 별도의 저자들이 독립적으로 쓴 글이라, 분량도 다르고,
  다루는 내용도 다르고, 문장 순서도 다릅니다. 두 코퍼스를 그냥 섞어서 "다음 토큰 맞추기"로 학습시키면, 모델은 "이 한국어 문단과 저 영어 문단이
  같은 의미다"라는 신호를 전혀 받지 못합니다 — 그냥 같은 파라미터 공간 안에 두 개의 독립된 언어 능력이 나란히 쌓일 뿐이지, 둘을 잇는 다리가
  저절로 생기지 않습니다. 지난번 "베이스 모델이 처음 보는 지식은 SFT로 못 만든다"는 얘기와 같은 원리가 여기도 적용됩니다 — 정렬(alignment) 
  신호가 없는 데이터는 아무리 섞어도 번역 능력을 만들지 않습니다.
  
  실제로 이걸 해낸 방법이 있습니다 — WikiMatrix 

  Meta(당시 Facebook AI)가 정확히 "위키백과에서 자동으로 문장 쌍을 뽑아내는" 문제를 풀었습니다:

  - LASER라는 다국어 문장 임베딩 모델로 93개 언어의 문장을 같은 벡터 공간에 투영
  - 한국어 문장과 영어 문장의 벡터가 얼마나 가까운지(의미적으로 비슷한지) 계산해서, 진짜로 비슷한 뜻인 문장 쌍만 골라냄
  - 이렇게 85개 언어에서 1억 3,500만 개 병렬 문장을 자동으로 채굴했고, 결과물이 공개돼 있습니다

  즉 "위키 두 개를 그냥 넣는 것"과 "WikiMatrix식으로 의미 유사도를 계산해서 진짜 대응 문장만 골라내는 것" 사이엔 **완전히 다른 파이프라인
  하나(문장 임베딩 모델 + 유사도 필터링)**가 끼어 있습니다. 다행히 이건 우리가 처음부터 만들 필요 없이, WikiMatrix가 이미 뽑아놓은 한영 병렬
  문장 쌍을 가져다 쓰는 게 현실적입니다.
 
  정리하면

  ❌ 한국어 위키 + 영어 위키를 그냥 같이 넣기
     → 두 언어를 "따로따로" 아는 모델은 될 수 있어도, 번역은 안 됨
 
  ✅ WikiMatrix 같은 이미 정렬된 병렬 코퍼스를 사전학습/SFT에 넣기
     → "이 한국어 문장 = 이 영어 문장"이라는 신호가 명시적으로 존재

 

[링크 : https://opus.nlpl.eu/datasets/WikiMatrix]

[링크 : https://huggingface.co/datasets/SEACrowd/wikimatrix]

'모종의 음모 > ai 프로그램' 카테고리의 다른 글

diffusion gemma  (0) 2026.09.23
직접만든 LLM .. part 2  (0) 2026.09.23
직접 LLM 만들...기?  (0) 2026.09.22
llama-tokenize  (0) 2026.09.22
llama-cli /clear  (0) 2026.09.22
Posted by 구차니