0. PDF와 DOCX의 구조적 차이: 고정 좌표계에서 리플로우 트리로의 변환
PDF(Portable Document Format)를 Microsoft Word(DOCX)로 변환하는 작업은 단순한 파일 확장자 변경이 아닙니다. 컴퓨터 공학적으로 두 포맷은 문서를 표현하는 데이터 아키텍처가 완전히 상반되기 때문에 복잡한 ‘문서 역공학(Document Reverse Engineering)’ 알고리즘이 요구됩니다.
graph LR
subgraph PDF_Structure[PDF: 2D 절대 좌표계 구조]
A[PostScript 벡터 엔진] --> B[문자 글리프 Glyph 절대 x,y 좌표]
A --> C[표 라인: 단순 선분 벡터 그리기]
end
subgraph Conversion_Engine[문서 역공학 파서 Engine]
D[좌표 클러스터링 & 단락 재구성]
E[선분 교차 분석: 표 테이블 복원]
F[폰트 매핑 & 유니코드 정규화]
end
subgraph DOCX_Structure[DOCX: OOXML 흐름형 계층 트리]
G[w:document 계층 노드] --> H[단락 Paragraph & Run 텍스트 흐름]
G --> I[w:tbl 정형 테이블 구조]
end
PDF_Structure --> Conversion_Engine --> DOCX_Structure
- PDF의 특성: 인쇄 품질 유지를 위해 모든 글자와 도형이 2차원 평면의 절대 좌표(\((x, y)\) 포인트)에 박혀 있습니다. 단락, 문장, 표라는 개념이 존재하지 않으며 단순히 ’특정 좌표에 글자 모양(Glyph)을 그리는 명령’들의 나열입니다.
- DOCX의 특성: 화면 크기나 마진에 따라 글이 자연스럽게 다음 줄로 넘어가는 리플로우(Reflow) 계층형 XML(OOXML) 구조입니다.
- 변환 엔진의 핵심 과제: 흩어져 있는 수천 개의 문자 좌표를 군집화(Clustering)하여 원본의 문단, 줄바꿈, 2단 편집, 표(Table)의 테두리를 오차 없이 복원해내는 것이 엔진의 핵심 기술력입니다.
1. 4대 주요 PDF to DOCX 엔진 정밀 벤치마크
| 평가 항목 | Adobe Acrobat Online | Smallpdf | iLovePDF | PDF24 Tools (권장) |
|---|---|---|---|---|
| 기반 변환 엔진 | Adobe 정품 독점 변환 엔진 | 자체 클라우드 파서 + OCR | 멀티 테넌트 클라우드 엔진 | 독자 엔진 + 오프라인 데스크톱 지원 |
| 복합 표(Table) 복원율 | 98% (셀 병합, 테두리 완벽 유지) | 85% (일부 텍스트 박스로 치환) | 82% (표 선 깨짐 다소 발생) | 92% (깔끔한 Word 네이티브 표 생성) |
| 한글 폰트 글리프 매핑 | 우수 (돋움/바탕/나눔 폰트 유지) | 양호 (일부 띄어쓰기 공백 오류) | 보통 (특수문자/한자 누락 가능) | 매우 우수 (유니코드 한글 완벽 보존) |
| 스캔본 OCR 인식 지원 | 고성능 머신러닝 OCR 탑재 | Tesseract 기반 OCR 지원 | 상용 OCR (유료 플랜 한정) | 무료 무제한 다국어 OCR 지원 |
| 일일 무료 사용 제한 | 계정당 1~2회 무료 | 1일 2개 파일 무료 | 1시간당 작업 제한 | 횟수/용량 제한 완전 무료 (광고 기반) |
2. 한글 문서 변환 시 폰트 깨짐 및 자간 왜곡 원인과 해결책
국내 사용자가 공공기관이나 기업의 PDF 문서를 Word로 변환할 때 가장 자주 겪는 문제는 ‘한글 폰트가 깨지거나 외계어 문자(CID Font)로 출력되는 현상’입니다.
flowchart TD
ScanFont[PDF 파일 내 폰트 구조 진단] --> CheckEmbed{폰트 임베딩 방식}
CheckEmbed -->|트루타입/오픈타입 서브셋 포함| Success[정상 텍스트 추출: 변환 성공]
CheckEmbed -->|ToUnicode 매핑 테이블 누락| Corrupt[CID 폰트 외계어 깨짐 현상 발생]
CheckEmbed -->|비트맵 이미지 래스터화 문서| OCRNeed[스캔 이미지: OCR 텍스트 추출 필수]
Corrupt --> Fix1[PDF 드라이버 재인쇄로 폰트 재임베딩 or OCR 강제 변환]
OCRNeed --> Fix2[한국어 언어팩 활성화 OCR 엔진 적용]
2-1. CID(Character Identifier) 폰트와 ToUnicode 매핑 테이블 누락
- 한글 폰트는 글자 수가 11,172자에 달하므로 PDF 생성 시 파일 용량을 줄이기 위해 문서에 쓰인 글자만 축약 임베딩하는 ‘서브셋 폰트(Subset Font)’를 사용합니다.
- 이때 원본 PDF 제작 프로그램이 글리프 코드와 유니코드(UTF-8) 문자를 매핑해 주는
ToUnicodeCMap 테이블을 누락시키면, 변환 엔진은 해당 문자가 어떤 한글인지 알 수 없어 네모(□)나 특수문자로 출력하게 됩니다. - 해결 프로토콜: 이 경우 일반 텍스트 변환 엔진 대신 ‘OCR(광학문자인식) 강제 적용’ 옵션을 활성화하여 글자 형태를 광학적으로 재스캔하여 추출해야 100% 정상 변환됩니다.
3. 클라우드 변환 서비스의 개인정보 보안 및 GDPR 규정 분석
민감한 개인정보(주민등록번호, 금융 거래 내역)나 기업 대외비 계약서가 포함된 문서를 온라인 변환기에 업로드할 때는 데이터 유출 리스크를 엄격히 검토해야 합니다.
sequenceDiagram
participant User as 사용자 브라우저
participant Cloud as 변환 클라우드 서버
participant Storage as 임시 스토리지 버킷
User->>Cloud: 1. TLS 1.3 암호화 파일 전송
Cloud->>Storage: 2. 임시 컨테이너에 암호화 저장 (AES-256)
Cloud->>Cloud: 3. 인메모리 프로세스로 DOCX 렌더링
Cloud->>User: 4. 다운로드 링크 제공
Storage-->>Storage: 5. 60분 경과 후 데이터베이스 및 스토리지 영구 삭제 (Zero Retention)
3-1. 주요 플랫폼별 데이터 보존 및 보안 규격
- PDF24 Tools (독일 기반):
- 유럽연합의 엄격한 개인정보보호법(GDPR)을 100% 준수합니다.
- 업로드된 모든 파일은 변환 완료 후 1시간 이내에 서버 디스크에서 암호화 영구 파기됩니다.
- 파일 내용을 제3자와 공유하거나 AI 모델 학습에 사용하지 않는다고 약관에 명시되어 있습니다.
- 오프라인 데스크톱 앱 활용 권장 (PDF24 Desktop):
- 군사, 금융, 의료 등 절대 외부망으로 유출되어서는 안 되는 극비 문서의 경우, 클라우드 웹사이트 대신 ‘PDF24 크리에이터(오프라인 설치형 데스크톱 프로그램)’를 사용하는 것이 안전합니다. 모든 변환이 로컬 PC의 CPU/RAM 안에서만 수행되므로 네트워크 트래픽이 0byte입니다.
4. 완벽한 변환 품질을 위한 3단계 실무 가이드
- 파일 사전 최적화: 변환 전 PDF 파일 내에 불필요한 페이지나 고용량 이미지가 있다면 먼저 필요한 페이지만 분할(Split)하여 업로드 속도와 엔진 처리 정확도를 높입니다.
- 복합 표가 많은 문서: 표 테두리 선이 흐릿한 경우 인식이 실패할 수 있으므로, Adobe Acrobat Online의 네이티브 엔진을 우선 사용하는 것이 표 구조 보존에 가장 유리합니다.
- 변환 후 서식 검수:
- Word에서 파일을 연 즉시 ‘숨겨진 서식 기호(¶)’를 활성화하여, 줄바꿈이 문단 바꿈(Enter)으로 잘못 들어갔는지 단락 흐름(Shift+Enter)으로 들어갔는지 확인합니다.
- 글꼴이 기본 폰트로 치환되었다면
Ctrl + A로 전체 선택 후 ‘맑은 고딕’ 또는 ’나눔스퀘어’로 일괄 변경합니다.
공식 표준 및 기술 표준 사양
- ISO 32000-2:2020 문서 관리 — 휴대용 문서 형식 (PDF 2.0 규격)
- ECMA-376 Office Open XML (DOCX 파일 포맷 사양)
- 유럽연합 일반개인정보보호법 (GDPR) 데이터 처리 가이드라인