문서 유틸리티

PDF 엑셀 표 추출

PDF 문서 안의 표 데이터를 읽어 CSV 또는 엑셀 파일로 저장할 수 있습니다. 텍스트 기반 PDF의 표 데이터를 페이지별로 분석하고, 추출 결과를 미리 확인한 뒤 다운로드해 보세요.

PDF 표 데이터 추출 PDF 안의 텍스트 위치를 분석해 표처럼 정리하고 CSV 또는 XLSX 파일로 저장합니다.
페이지별 후보 확인 전체 결과와 페이지별 추출 후보를 미리보기로 확인한 뒤 필요한 데이터를 저장할 수 있습니다.
데이터 정리 옵션 첫 행 헤더 사용, 빈 행 제거, 빈 열 정리 옵션으로 엑셀에서 쓰기 좋은 형태로 다듬습니다.
File 미선택
Pages 전체
Candidates 0
Status Ready

PDF 업로드 및 추출 설정

표를 추출할 PDF 파일을 업로드한 뒤 페이지 범위와 표 인식 민감도를 설정하세요. 텍스트 기반 PDF에서 가장 안정적으로 동작합니다.

PDF 업로드

Drag & Drop 또는

PDF 1개 · 최대 80MB · 한 번에 최대 200페이지 분석

안내 이 도구는 PDF 텍스트의 좌표를 바탕으로 표 구조를 추정합니다. 스캔본, 이미지형 PDF, 표선이 복잡한 문서는 결과가 부정확할 수 있습니다.

비워두면 전체 페이지를 분석합니다. 일부 페이지만 추출할 때 범위를 입력하세요.

열이 너무 많이 나뉘면 넓게, 서로 다른 열이 합쳐지면 촘촘하게 조정하세요.

행이 잘게 쪼개지면 넓게, 여러 줄이 한 행으로 합쳐지면 촘촘하게 조정하세요.

CSV와 XLSX 다운로드 시 사용할 파일명입니다. 확장자는 자동으로 붙습니다.

추출 전 확인

표 셀이 일정한 간격으로 정렬된 텍스트형 PDF일수록 정확도가 높습니다.

여러 표가 섞여 있거나 표선이 복잡한 문서는 페이지별 후보를 먼저 확인한 뒤 저장하는 것을 권장합니다.

아직 업로드된 PDF가 없습니다.

추천 추출 프리셋

PDF 표 형태에 맞춰 페이지 범위와 행·열 민감도를 빠르게 적용할 수 있습니다.

추출 상태

선택한 페이지, 추출 후보 수, 현재 처리 상태를 확인할 수 있습니다.

대기 중
선택 페이지 -
추출 후보 -
현재 상태 대기 중
PDF를 업로드하면 추출 결과가 여기에 표시됩니다.

사용 방법

01

PDF 파일 업로드

텍스트 선택이 가능한 PDF 파일을 드래그하거나 파일 선택 버튼으로 불러오세요. 스캔본은 OCR 처리 후 사용하는 것이 좋습니다.

02

페이지와 간격 설정

전체 페이지 또는 1-3,5처럼 필요한 페이지를 지정하고 표 구조에 맞게 행·열 간격 민감도를 조정하세요.

03

추출 결과 미리보기

페이지별 표 후보와 행·열 개수를 확인한 뒤 헤더, 빈 행, 빈 열 정리 옵션이 적절한지 살펴보세요.

04

CSV 또는 XLSX 저장

데이터 가공이나 시스템 업로드에는 CSV를, 엑셀에서 바로 편집할 목적이면 XLSX 파일로 다운로드하세요.

도움말

PDF 엑셀 표 추출은 언제 사용하나요?

PDF 보고서, 명세서, 견적서, 통계표, 정산표처럼 표 형태의 데이터를 엑셀에서 다시 활용해야 할 때 사용할 수 있습니다. 추출된 데이터를 CSV 또는 XLSX로 저장하면 엑셀, 구글 스프레드시트 등에서 편집하기 쉽습니다.

텍스트 기반 PDF와 스캔본 PDF의 차이

이 유틸리티는 PDF 안에 포함된 텍스트와 위치 정보를 읽어 표 구조를 추정합니다. 따라서 텍스트 선택이 가능한 PDF에서 더 잘 동작하며, 이미지로 스캔된 PDF는 OCR 기능이 아니기 때문에 정확도가 낮을 수 있습니다.

열 간격 민감도는 어떻게 조정하나요?

열이 너무 많이 나뉘어 보이면 넓게 옵션을 선택하세요. 반대로 서로 다른 열이 하나로 합쳐진다면 촘촘하게 옵션을 선택하면 결과가 나아질 수 있습니다.

행 간격 민감도는 어떻게 조정하나요?

한 행이 여러 줄로 쪼개진다면 넓게 옵션을 선택하고, 여러 행이 하나로 합쳐진다면 촘촘하게 옵션을 선택해 보세요. PDF의 줄 간격과 글자 배치에 따라 적절한 값이 달라질 수 있습니다.

CSV와 XLSX 중 무엇을 선택하면 좋나요?

CSV는 대부분의 프로그램에서 열 수 있는 범용 형식이고, XLSX는 엑셀에서 바로 사용하기 편한 형식입니다. 엑셀 작업이 목적이라면 XLSX를, 다른 시스템으로 가져오기 위한 데이터라면 CSV를 선택하는 것이 좋습니다.

자주 묻는 질문

스캔된 PDF에서도 표를 추출할 수 있나요?

정확도가 낮을 수 있습니다. 이 도구는 OCR이 아니라 PDF 내부 텍스트 정보를 분석하는 방식입니다. 스캔본처럼 이미지로만 구성된 PDF는 먼저 OCR 처리가 필요할 수 있습니다.

표가 이상하게 여러 열로 쪼개져요.

열 간격 민감도를 넓게 조정한 뒤 다시 추출해 보세요. 글자 간격이 좁거나 숫자가 촘촘하게 배치된 PDF에서는 기본값보다 넓은 설정이 더 안정적일 수 있습니다.

여러 행이 하나로 합쳐져 보여요.

행 간격 민감도를 촘촘하게 변경해 보세요. 행 사이 간격이 좁은 표는 기본값에서 행 구분이 약하게 처리될 수 있습니다.

첫 행을 헤더로 사용 옵션은 무엇인가요?

추출된 첫 번째 행을 컬럼명처럼 사용하는 옵션입니다. 표의 첫 줄이 제목 행이라면 켜두는 것이 좋고, 첫 줄부터 실제 데이터라면 해제하는 것이 좋습니다.

업로드한 PDF는 서버에 저장되나요?

선택한 PDF는 현재 브라우저에서 PDF.js로 분석하며 win-j 서버로 전송하거나 저장하지 않습니다. 추출 결과와 CSV·XLSX 파일도 브라우저에서 생성됩니다.

EDITORIAL GUIDE

PDF 표를 엑셀로 옮길 때 행과 열을 검수하는 방법

텍스트 선택이 가능한 PDF의 글자와 좌표를 페이지별로 분석해 표 후보를 만들고 CSV 또는 XLSX로 저장하는 도구입니다. 표 구조 자체를 읽는 것이 아니라 글자 위치를 행·열로 추정하므로 병합 셀, 여러 단, 스캔 이미지와 복잡한 배치는 반드시 미리보기에서 수정 가능성을 확인해야 합니다.

이런 분께 유용합니다

  • PDF 보고서나 명세서의 표를 스프레드시트에서 다시 사용하려는 사용자
  • 전체 문서가 아니라 특정 페이지 범위의 표 후보만 추출하려는 사용자
  • 행·열 간격을 조절해 PDF 글자의 좌표 그룹을 직접 비교하려는 사용자

대표 활용 상황

  • 정렬이 일정한 통계표를 페이지별 XLSX 시트로 옮길 때
  • 견적서의 몇 페이지만 CSV로 추출해 원본과 대조할 때
  • 기본 설정에서 갈라진 열을 간격 옵션으로 다시 묶어 볼 때

처음부터 결과 확인까지

  1. 1

    텍스트를 드래그해 선택할 수 있는 80MB 이하 PDF를 준비합니다.

  2. 2

    전체 또는 최대 200페이지 안에서 1-3,5 같은 분석 범위를 지정합니다.

  3. 3

    기본 행 6·열 16 간격으로 먼저 추출하고 페이지별 후보를 확인합니다.

  4. 4

    행이 합쳐지거나 열이 갈라지면 촘촘하게·기본·넓게 옵션을 바꿔 재분석합니다.

  5. 5

    첫 행 헤더와 빈 행·빈 열 제거 결과가 원본 구조와 맞는지 비교합니다.

  6. 6

    CSV 또는 페이지별 시트가 있는 XLSX로 저장한 뒤 숫자·날짜·단위를 원본과 대조합니다.

실제 예시 1

3페이지 통계표를 XLSX로 저장

입력
페이지 1-3 / 열 간격 16 / 행 간격 6 / 첫 행 헤더 켬
결과
텍스트 후보가 있는 각 페이지를 Page 1·Page 2·Page 3 시트로 구성

페이지별 추출 행을 그대로 워크시트에 넣습니다. 표가 없는 페이지는 결과 시트가 만들어지지 않을 수 있습니다.

실제 예시 2

한 열이 여러 열로 갈라진 경우

입력
기본 열 간격에서 주소가 여러 셀로 분리 / 열 간격을 넓게 24로 재실행
결과
서로 가까운 X 좌표를 같은 열 중심으로 묶을 가능성 증가

간격을 너무 넓히면 원래 다른 열도 합쳐질 수 있으므로 미리보기와 원본을 함께 봐야 합니다.

계산·처리 기준

PDF 파일을 ArrayBuffer로 읽고 PDF.js의 각 페이지 getTextContent 결과에서 문자열과 변환 행렬의 X·Y 좌표를 가져옵니다. Y 좌표 차이가 선택한 행 허용값 안인 항목을 같은 행으로 묶고, X 좌표를 열 허용값 기준으로 군집화해 각 셀 위치를 정합니다. 빈 행·열을 옵션에 따라 제거한 뒤 CSV는 페이지 구분을 포함한 텍스트로, XLSX는 페이지별 워크시트로 생성합니다.

알아둘 한계

  • 스캔본과 이미지형 PDF는 OCR 기능이 아니므로 내부 텍스트가 없으면 추출할 수 없습니다.
  • 병합 셀, 세로쓰기, 회전 글자, 여러 단과 복잡한 표선은 좌표만으로 원래 구조를 복원하기 어렵습니다.
  • 숫자·날짜·통화는 원본 문자열로 옮겨지며 스프레드시트 데이터 형식을 자동 판정하지 않습니다.
  • 암호화·손상 PDF, 특수 글꼴과 지나치게 큰 문서는 브라우저 메모리나 PDF.js 처리 한계로 실패할 수 있습니다.
개인정보 처리

PDF 원본과 추출 결과는 현재 브라우저에서 로컬 PDF.js·SheetJS 파일로 처리하며 win-j 서버로 전송하거나 저장하지 않습니다. 다운로드한 CSV·XLSX만 사용자 기기에 남으며 공용 기기에서는 파일 보관 위치를 확인하세요.

함께 쓰면 좋은 도구

자주 묻는 질문

표선이 보이는데도 열이 정확히 나뉘지 않는 이유는 무엇인가요?

도구는 표선을 해석하지 않고 글자의 X·Y 좌표를 묶습니다. 글자 간격이 불규칙하거나 병합 셀이 있으면 원래 표 구조와 다를 수 있습니다.

PDF의 계산식이나 셀 서식도 Excel로 옮겨지나요?

아닙니다. 보이는 텍스트를 2차원 행으로 옮기며 원본 표의 계산식, 데이터 형식, 색상과 테두리는 복원하지 않습니다.

200페이지가 넘는 문서는 어떻게 처리하나요?

페이지 범위를 최대 200페이지씩 나누어 여러 번 추출하세요. 대용량 문서는 처리 전 사본을 나누면 브라우저 메모리 부담도 줄일 수 있습니다.