다국어 AI 학습 데이터 주석 (Annotation) 프로젝트
요즘 많은 기업이 사내에 쌓인 문서를 AI에 학습시키려 하지만, 여러 언어로 뒤섞인 스캔 파일과 PDF는 그대로 넣을 수 없습니다. 정리가 부실하면 AI가 엉뚱한 답을 지어내거나 개인정보를 그대로 노출하기 때문입니다. 한샘글로벌은 방대한 다국어 문서 더미를 AI가 믿고 학습할 수 있는 깔끔한 데이터로 정리했습니다.
여러 언어로 뒤섞인 수만 페이지의 문서를, 개인정보 지적 0건으로 AI가 학습할 수 있는 데이터로 정리했습니다. 문서를 하나씩 처리하는 대신 모든 언어가 공유하는 공통 기준을 먼저 세운 덕분입니다.
프로젝트 개요
요즘 많은 기업이 사내에 쌓인 문서를 AI에게 학습시켜 챗봇이나 업무 도우미를 만들려고 합니다. 그런데 스캔 파일이나 PDF를 그대로 AI에 넣을 수는 없습니다. 어떤 정보가 이름이고, 날짜이고, 금액인지 사람이 먼저 표시해 정리해 주어야 합니다. 이 표시 작업을 ‘주석(annotation)’이라고 부릅니다. 정리가 부실하면 AI는 엉뚱한 답을 지어내거나 개인정보를 그대로 노출합니다. 서비스에 나가기도 전에 문제가 되는 것입니다. 한샘글로벌은 여러 언어로 뒤섞인 방대한 문서 더미를, AI가 믿고 학습할 수 있는 깔끔한 데이터로 정리했습니다
도전 과제
원본 문서는 상태가 제각각이었습니다. 같은 종류의 서식인데도 항목 이름이 서로 달랐고, 표나 반복되는 부분이 파일마다 다르게 정리돼 있었습니다. 문서를 하나씩 표시하기 전에, 모두가 똑같이 따를 공통 기준부터 세워야 하는 상황이었습니다.
게다가 문서 안에는 이름, 신분증 번호, 전화번호, 금액 같은 실제 개인정보가 4개 언어와 2개 지역에 걸쳐 들어 있었습니다. 이 정보가 학습 데이터에 그대로 새어 나가면 법적으로 큰 문제가 됩니다. 여기에 수십 명이 4개 언어로 동시에 작업하는 만큼, 판단 기준이 사람마다 흔들리지 않게 붙잡아 두는 일도 과제였습니다.
한샘글로벌의 대응
1. 공통 기준부터 만들었습니다
문서를 무작정 표시하기 시작하면 결과가 제각각이 됩니다. 그래서 한샘글로벌은 먼저 4개 언어의 대표 문서들을 분석해, 무엇을 어떻게 표시할지에 대한 공통 규칙을 만들었습니다. 각 항목마다 값의 종류(글자인지 숫자인지, 예·아니오인지)와 설명을 정하고, 문서에서 그대로 옮기면 되는 값인지 계산이 필요한 값인지도 구분해 두었습니다. 주소나 날짜처럼 여러 문서에 반복되는 정보는 한 번 만들어 재사용할 수 있게 정리했습니다.
2. 품질과 개인정보를 작업하는 그 자리에서 잡았습니다
표시가 다 끝난 뒤에 검사하는 방식은 늦습니다. 한샘글로벌은 20개가 넘는 점검 항목을 만들어, 언어가 섞이지 않았는지, 형식이 맞는지, 앞뒤가 안 맞는 내용은 없는지를 작업하는 그 자리에서 확인했습니다. 특히 지역별 개인정보 규정을 이 점검표 안에 넣어, 형식이 틀린 신분증 번호나 전화번호를 나중에 따로 감사할 필요 없이 바로 걸러냈습니다.
3. 애매한 경우만 모아 고객사와 확인했습니다
자료만으로 판단이 서지 않는 예외 사례들은 따로 모아, 정해진 주기에 고객사와 함께 정리했습니다. 이렇게 확정된 판단은 다시 규칙에 반영했습니다. 덕분에 담당자를 매번 부르지 않고도, 한 번 내린 결정이 이후 모든 작업에 그대로 적용되도록 만들었습니다.
결과
| 수만 페이지 4개 언어·2개 지역 문서 정리 |
99%+ 품질 점검 통과율 (20개+ 항목) |
0건 지역 검토 개인정보 지적 |
|---|
이 프로젝트는 단순한 번역을 넘어선 작업이었습니다. 여러 언어와 지역 규정을 동시에 다루면서 방대한 문서를 하나의 기준으로 정리해야 했고, 개인정보 관리에도 빈틈이 없어야 했습니다. 한샘글로벌은 문서 설계와 다국어 작업, 지역별 규정 대응을 한데 묶어 이러한 고난도 데이터 작업을 안정적으로 수행합니다. 35년 넘게 매뉴얼과 기술 문서를 다뤄 온 언어 전문성이 그 바탕이 됩니다.
이와 같은 데이터 구조 설계와 대규모 주석·검수 방식은 피지컬 AI 학습 데이터에도 적용할 수 있습니다. 예를 들어 로봇의 작업과 행동을 일정한 기준으로 구분하는 로봇 행동 데이터 주석, 작업·행동 단위의 데이터 스키마 설계, 대규모 피지컬 AI 데이터 품질 검수 등이 같은 방식의 확장 영역입니다.
자주 묻는 질문
- 문서 안의 개인정보는 어떻게 처리하나요?
- 모든 개인정보는 실제 정보를 지우고, 형식만 똑같은 가짜 정보로 바꿔 넣습니다. 예를 들어 신분증 번호나 전화번호는 그냥 가리는 대신, 실제 그 나라 양식에 맞는 가짜 번호를 새로 만들어 넣습니다. 이렇게 하면 실제 개인정보는 사라지지만, 문서는 학습과 테스트에 그대로 쓸 수 있습니다.
- 여러 언어를 동시에 일관되게 정리할 수 있나요?
- 가능합니다. 언어가 달라도 같은 항목은 같은 방식으로 표시되도록, 모든 언어가 공유하는 공통 기준을 먼저 세우기 때문입니다. 여기에 각 언어의 원어민 검수자가 번역이나 형식에서 놓친 부분이 없는지 확인합니다. 이번 프로젝트에서도 하나의 공통 기준을 4개 언어에 똑같이 적용하고, 그 위에 지역별 규정을 더했습니다. 매뉴얼 개발과 번역·현지화 서비스를 검토하고 계시다면 문의를 남겨 주시기 바랍니다. 서비스별로 특화된 전담 인력이 상세하게 안내해 드립니다.