PDF 파일 업로드
텍스트 선택이 가능한 PDF 파일을 드래그하거나 파일 선택 버튼으로 불러오세요. 스캔본은 OCR 처리 후 사용하는 것이 좋습니다.
문서 유틸리티
PDF 문서 안의 표 데이터를 읽어 CSV 또는 엑셀 파일로 저장할 수 있습니다. 텍스트 기반 PDF의 표 데이터를 페이지별로 분석하고, 추출 결과를 미리 확인한 뒤 다운로드해 보세요.
표를 추출할 PDF 파일을 업로드한 뒤 페이지 범위와 표 인식 민감도를 설정하세요. 텍스트 기반 PDF에서 가장 안정적으로 동작합니다.
Drag & Drop 또는
PDF 1개 · 최대 80MB · 한 번에 최대 200페이지 분석
비워두면 전체 페이지를 분석합니다. 일부 페이지만 추출할 때 범위를 입력하세요.
열이 너무 많이 나뉘면 넓게, 서로 다른 열이 합쳐지면 촘촘하게 조정하세요.
행이 잘게 쪼개지면 넓게, 여러 줄이 한 행으로 합쳐지면 촘촘하게 조정하세요.
CSV와 XLSX 다운로드 시 사용할 파일명입니다. 확장자는 자동으로 붙습니다.
표 셀이 일정한 간격으로 정렬된 텍스트형 PDF일수록 정확도가 높습니다.
여러 표가 섞여 있거나 표선이 복잡한 문서는 페이지별 후보를 먼저 확인한 뒤 저장하는 것을 권장합니다.
PDF 표 형태에 맞춰 페이지 범위와 행·열 민감도를 빠르게 적용할 수 있습니다.
선택한 페이지, 추출 후보 수, 현재 처리 상태를 확인할 수 있습니다.
전체 결과 또는 페이지별 표 후보를 확인한 뒤 CSV 또는 XLSX로 저장할 수 있습니다.
텍스트 선택이 가능한 PDF 파일을 드래그하거나 파일 선택 버튼으로 불러오세요. 스캔본은 OCR 처리 후 사용하는 것이 좋습니다.
전체 페이지 또는 1-3,5처럼 필요한 페이지를 지정하고 표 구조에 맞게 행·열 간격 민감도를 조정하세요.
페이지별 표 후보와 행·열 개수를 확인한 뒤 헤더, 빈 행, 빈 열 정리 옵션이 적절한지 살펴보세요.
데이터 가공이나 시스템 업로드에는 CSV를, 엑셀에서 바로 편집할 목적이면 XLSX 파일로 다운로드하세요.
PDF 보고서, 명세서, 견적서, 통계표, 정산표처럼 표 형태의 데이터를 엑셀에서 다시 활용해야 할 때 사용할 수 있습니다. 추출된 데이터를 CSV 또는 XLSX로 저장하면 엑셀, 구글 스프레드시트 등에서 편집하기 쉽습니다.
이 유틸리티는 PDF 안에 포함된 텍스트와 위치 정보를 읽어 표 구조를 추정합니다. 따라서 텍스트 선택이 가능한 PDF에서 더 잘 동작하며, 이미지로 스캔된 PDF는 OCR 기능이 아니기 때문에 정확도가 낮을 수 있습니다.
열이 너무 많이 나뉘어 보이면 넓게 옵션을 선택하세요. 반대로 서로 다른 열이 하나로 합쳐진다면 촘촘하게 옵션을 선택하면 결과가 나아질 수 있습니다.
한 행이 여러 줄로 쪼개진다면 넓게 옵션을 선택하고, 여러 행이 하나로 합쳐진다면 촘촘하게 옵션을 선택해 보세요. PDF의 줄 간격과 글자 배치에 따라 적절한 값이 달라질 수 있습니다.
CSV는 대부분의 프로그램에서 열 수 있는 범용 형식이고, XLSX는 엑셀에서 바로 사용하기 편한 형식입니다. 엑셀 작업이 목적이라면 XLSX를, 다른 시스템으로 가져오기 위한 데이터라면 CSV를 선택하는 것이 좋습니다.
정확도가 낮을 수 있습니다. 이 도구는 OCR이 아니라 PDF 내부 텍스트 정보를 분석하는 방식입니다. 스캔본처럼 이미지로만 구성된 PDF는 먼저 OCR 처리가 필요할 수 있습니다.
열 간격 민감도를 넓게 조정한 뒤 다시 추출해 보세요. 글자 간격이 좁거나 숫자가 촘촘하게 배치된 PDF에서는 기본값보다 넓은 설정이 더 안정적일 수 있습니다.
행 간격 민감도를 촘촘하게 변경해 보세요. 행 사이 간격이 좁은 표는 기본값에서 행 구분이 약하게 처리될 수 있습니다.
추출된 첫 번째 행을 컬럼명처럼 사용하는 옵션입니다. 표의 첫 줄이 제목 행이라면 켜두는 것이 좋고, 첫 줄부터 실제 데이터라면 해제하는 것이 좋습니다.
선택한 PDF는 현재 브라우저에서 PDF.js로 분석하며 win-j 서버로 전송하거나 저장하지 않습니다. 추출 결과와 CSV·XLSX 파일도 브라우저에서 생성됩니다.
텍스트 선택이 가능한 PDF의 글자와 좌표를 페이지별로 분석해 표 후보를 만들고 CSV 또는 XLSX로 저장하는 도구입니다. 표 구조 자체를 읽는 것이 아니라 글자 위치를 행·열로 추정하므로 병합 셀, 여러 단, 스캔 이미지와 복잡한 배치는 반드시 미리보기에서 수정 가능성을 확인해야 합니다.
텍스트를 드래그해 선택할 수 있는 80MB 이하 PDF를 준비합니다.
전체 또는 최대 200페이지 안에서 1-3,5 같은 분석 범위를 지정합니다.
기본 행 6·열 16 간격으로 먼저 추출하고 페이지별 후보를 확인합니다.
행이 합쳐지거나 열이 갈라지면 촘촘하게·기본·넓게 옵션을 바꿔 재분석합니다.
첫 행 헤더와 빈 행·빈 열 제거 결과가 원본 구조와 맞는지 비교합니다.
CSV 또는 페이지별 시트가 있는 XLSX로 저장한 뒤 숫자·날짜·단위를 원본과 대조합니다.
페이지별 추출 행을 그대로 워크시트에 넣습니다. 표가 없는 페이지는 결과 시트가 만들어지지 않을 수 있습니다.
간격을 너무 넓히면 원래 다른 열도 합쳐질 수 있으므로 미리보기와 원본을 함께 봐야 합니다.
PDF 파일을 ArrayBuffer로 읽고 PDF.js의 각 페이지 getTextContent 결과에서 문자열과 변환 행렬의 X·Y 좌표를 가져옵니다. Y 좌표 차이가 선택한 행 허용값 안인 항목을 같은 행으로 묶고, X 좌표를 열 허용값 기준으로 군집화해 각 셀 위치를 정합니다. 빈 행·열을 옵션에 따라 제거한 뒤 CSV는 페이지 구분을 포함한 텍스트로, XLSX는 페이지별 워크시트로 생성합니다.
PDF 원본과 추출 결과는 현재 브라우저에서 로컬 PDF.js·SheetJS 파일로 처리하며 win-j 서버로 전송하거나 저장하지 않습니다. 다운로드한 CSV·XLSX만 사용자 기기에 남으며 공용 기기에서는 파일 보관 위치를 확인하세요.
도구는 표선을 해석하지 않고 글자의 X·Y 좌표를 묶습니다. 글자 간격이 불규칙하거나 병합 셀이 있으면 원래 표 구조와 다를 수 있습니다.
아닙니다. 보이는 텍스트를 2차원 행으로 옮기며 원본 표의 계산식, 데이터 형식, 색상과 테두리는 복원하지 않습니다.
페이지 범위를 최대 200페이지씩 나누어 여러 번 추출하세요. 대용량 문서는 처리 전 사본을 나누면 브라우저 메모리 부담도 줄일 수 있습니다.