변환 도구를 고를 때 데이터가 이동하는 경로 확인

OCR, JSON·XML 변환, 웹페이지 PDF 저장을 추가하면서 입력·변환·다운로드 흐름을 소개했습니다. 같은 변환 버튼이라도 처리 방식과 보존하는 정보는 다릅니다. 이 글에서는 세 도구를 작은 데이터로 비교하고, 결과에서 반드시 확인할 부분을 정리합니다.

JSON → XML: 배열 이름과 빈 값부터 결정

JSON·XML 변환기에서 루트 이름을 root, 배열 항목 이름을 item으로 두고 다음 JSON을 입력합니다.

{"name":"A&B","tags":["red","blue"]}

줄바꿈과 들여쓰기를 제외하면 결과 구조는 다음과 같습니다.

<root>
  <name>A&amp;B</name>
  <tags><item>red</item><item>blue</item></tags>
</root>

&를 &amp;로 표현하는 것은 XML 문법에 맞추기 위한 처리입니다. 배열은 tags 아래에 item을 반복하는 구조로 만들어집니다. 받는 API가 같은 태그를 바로 반복하는 다른 규칙을 요구한다면 이 결과를 그대로 사용할 수 없습니다.

빈 값 옵션도 살펴봅니다. 빈 값 제외를 선택하면 빈 문자열과 null 필드가 출력에서 빠질 수 있습니다. 상대 시스템에서 '필드 없음', '빈 문자열', 'null'을 다르게 처리한다면 이 선택이 의미를 바꿉니다.

XML → JSON: 왕복하면 원문으로 돌아오는가

다음 입력을 XML → JSON 방향으로 바꿉니다.

<root><code>0012</code><active>true</active></root>

현재 구현은 요소의 텍스트를 숫자·불리언 등으로 자동 해석하므로 결과는 다음과 같습니다.

{"root":{"code":12,"active":true}}

이 방향에는 CSV 도구와 같은 자동 형식 변환 해제 옵션이 없습니다. 앞자리 0이 필수인 코드를 보존해야 한다면 결과를 그대로 쓰지 말고 해당 규격에 맞는 변환 경로를 선택합니다.

현재 XML 읽기는 요소와 텍스트 중심이며 속성을 별도 키로 보존하지 않습니다. <user id="7">홍길동</user>의 id 속성, 텍스트와 자식 태그가 섞인 문장, 주석까지 손실 없이 왕복시키는 용도에는 적합하지 않습니다. JSON 키도 XML 태그 이름에 맞춰 정리되므로 공백·한글·기호가 들어간 키는 변환 후 이름을 비교합니다. 변환 성공 표시는 원본 의미가 모두 보존되었다는 보증이 아닙니다.

OCR은 읽은 문자열을 원본 이미지와 대조

이미지 OCR은 선택한 이미지를 전처리하고 브라우저의 Tesseract worker에서 문자를 인식합니다. 이미지의 문자 언어와 인식 언어를 맞춘 뒤, 여러 장을 넣기 전에 한 장으로 결과를 비교합니다. 초기 실행에는 인식 엔진·언어 데이터 로딩이 필요할 수 있습니다. Tesseract.js 프로젝트

예를 들어 영수증에서 8,800이 8,BOO처럼 읽히면 숫자 제거 도구로 강제로 정리하지 않습니다. 원본을 확대해 금액, 날짜, 단위부터 확인합니다. 이름·주소·계좌처럼 한 글자 차이가 중요한 부분도 그대로 복사하지 말고 대조합니다.

텍스트 추출이 끝났다고 표의 셀이나 읽기 순서까지 복원된 것은 아닙니다. 여러 열 문서는 읽는 순서가 섞일 수 있으므로 결과를 줄 단위로 확인합니다. OCR 결과를 CSV로 내려받더라도 원본 표가 자동 재구성되었다고 가정하면 안 됩니다.

웹페이지 PDF는 서버가 공개 URL에 접근

웹페이지 PDF 저장은 입력 URL과 출력 옵션을 서버로 보내고, 서버에서 해당 페이지를 열어 PDF를 만듭니다. 이용자의 현재 로그인 화면을 그대로 촬영하는 기능이 아닙니다. 따라서 로그인 뒤에만 보이는 페이지나 사내 주소는 대상으로 삼지 않습니다.

먼저 공개 문서 URL로 시험하고, 결과에서 페이지 수, 본문 끝부분, 표와 그림이 포함되었는지 확인합니다. 광고·머리말 제거 옵션은 출력에서 필요한 부분까지 영향을 줄 수 있으므로 결과가 빠져 보이면 해당 옵션을 바꾸어 비교합니다. 화면에 늦게 나타나는 내용도 PDF에 모두 들어간다고 보장할 수 없습니다.

공유하기 전 최종 점검

JSON·XML은 키와 자료형을, OCR은 문자와 읽기 순서를, 웹페이지 PDF는 페이지 범위와 누락을 확인합니다. 브라우저에서 처리하는 기능과 서버로 보내는 기능을 같은 개인정보 처리 방식으로 설명해서는 안 됩니다. 공개 URL에도 접근 토큰이나 개인 정보가 들어갈 수 있으므로 입력할 주소 전체를 먼저 살펴봅니다.

2026년 9월 22일 프로젝트의 변환 규칙과 요청 경로를 기준으로 보완했습니다. 예제에서 확인한 규칙을 넘어 모든 문서의 정확한 변환이나 모든 기기의 OCR 품질을 보장하지는 않습니다.