이런 분께 유용합니다
- 이미지로 받은 공지문이나 영수증을 편집 가능한 텍스트로 옮기려는 사용자
- 여러 JPG·PNG·WEBP 이미지의 문자를 한 번에 추출하려는 사용자
- 흐리거나 작은 글자를 확대·흑백·대비 처리해 다시 인식하려는 사용자
Document Utility
JPG, PNG, WEBP 이미지 속 텍스트를 OCR로 추출합니다. 여러 이미지 처리, 흑백 변환, 대비 강화, 확대 처리, 결과 복사 및 TXT·CSV 다운로드를 지원합니다.
텍스트를 추출할 이미지를 업로드하세요. 여러 장을 한 번에 선택할 수 있습니다.
OCR 처리 대상 이미지 목록입니다. 필요 없는 이미지는 개별 삭제할 수 있습니다.
이미지 상태에 맞게 언어, 인식 방식, 보정 옵션을 설정하세요.
이미지에 포함된 언어를 선택하면 OCR 정확도를 높일 수 있습니다.
문서, 영수증, 스크린샷 구조에 맞는 인식 방식을 선택하세요.
작은 글자는 2배 또는 3배 확대 시 더 잘 인식될 수 있습니다.
이미지 유형에 맞는 OCR 설정을 빠르게 적용할 수 있습니다.
추출된 텍스트를 확인하고 복사하거나 파일로 저장할 수 있습니다.
스크린샷, 스캔 문서, 영수증, 공지문, 사진 속 텍스트를 복사 가능한 문자로 변환할 때 사용합니다.
OCR 인식 언어가 이미지 속 언어와 일치할수록 정확도가 높아집니다. 일본어 이미지는 일본어, 중국어 이미지는 중국어 간체를 선택하세요. 여러 언어를 동시에 사용하면 속도와 정확도가 다소 낮아질 수 있습니다.
글자가 작거나 흐리다면 2배 또는 3배 확대를 사용하고 흑백 변환 및 대비 강화를 활성화하세요. 글자와 배경의 대비가 높을수록 인식 품질이 좋아집니다.
일반 문서는 기본 모드를 사용하고, 문단 구조가 뚜렷한 문서는 문단 중심 모드를 사용하세요. 한 줄 텍스트는 한 줄 모드, 자유로운 배치의 스크린샷은 자유 배치 모드를 선택하면 좋습니다.
OCR 정확도는 이미지 품질, 글자 크기, 글꼴, 기울기, 배경 노이즈에 따라 달라질 수 있습니다. 중요한 문서는 결과를 반드시 검토하세요.
선택한 이미지와 인식 결과는 win-j 서버로 전송하거나 저장하지 않고 현재 브라우저에서 처리합니다. 다만 OCR 실행에 필요한 작업 코드와 언어 데이터는 외부 CDN에서 내려받을 수 있어 처음 실행할 때 네트워크 연결이 필요합니다.
스크린샷·스캔 문서·영수증 이미지의 글자를 브라우저에서 인식해 복사하거나 TXT·CSV로 저장하는 도구입니다. OCR 결과는 이미지 품질과 언어·문단 모드에 따라 달라지므로 계약서, 금액, 계좌번호처럼 중요한 내용은 반드시 원본과 한 글자씩 대조해야 합니다.
JPG·PNG·WEBP 이미지를 최대 10개, 파일당 15MB·전체 60MB 안에서 선택합니다.
이미지에 실제로 쓰인 한국어·영어·일본어·중국어 조합을 선택합니다.
문서·문단·한 줄·흩어진 텍스트 중 이미지 배치와 가까운 인식 모드를 고릅니다.
작은 글자는 확대하되 확대 후 4천만 픽셀 제한을 넘지 않도록 조절합니다.
흑백과 대비 강화 전처리를 비교해 글자와 배경이 더 분명한 설정을 사용합니다.
추출 결과와 신뢰도를 참고하되 원본을 직접 대조한 후 복사하거나 TXT·CSV로 저장합니다.
작은 인쇄 글자를 2배 확대하고 명암 차이를 키워 인식을 돕지만 숫자 0·영문 O처럼 비슷한 문자는 원본 확인이 필요합니다.
페이지 분할 모드는 글자 배치를 해석하는 방법일 뿐 정확도를 보장하지 않으므로 결과를 직접 비교해야 합니다.
이미지를 FileReader로 읽고 선택 배율에 맞춘 Canvas에 다시 그립니다. 흑백 옵션은 RGB에 0.299·0.587·0.114 가중치를 적용하고, 대비 옵션은 각 채널을 128 기준 1.35배로 벌립니다. 한 번 생성한 Tesseract.js Web Worker에 선택 언어와 페이지 분할 모드를 설정해 선택 이미지를 순서대로 인식합니다. 신뢰도는 엔진이 반환한 참고 점수이며 정답률이나 법적 증명을 뜻하지 않습니다.
선택 이미지와 OCR 결과는 win-j 서버로 전송하거나 저장하지 않고 현재 브라우저에서 처리합니다. 다만 Tesseract.js 작업 코드와 언어 데이터는 외부 CDN에서 내려받을 수 있으므로 처음 실행에는 네트워크가 필요하며, 극도로 민감한 문서는 오프라인 전용 OCR을 사용하세요.
그렇게 단정할 수 없습니다. 엔진의 내부 참고 점수이며 실제 글자 단위 정확도와 같지 않습니다. 중요한 값은 원본과 직접 대조하세요.
한 번의 실행에서는 작업자 하나를 만들고 선택한 이미지를 순서대로 처리합니다. 페이지를 새로 열거나 다른 언어 데이터가 필요하면 관련 파일을 다시 불러올 수 있습니다.
현재 기능은 Tesseract.js에 이미지 Blob을 전달하는 방식입니다. PDF는 먼저 페이지를 이미지로 렌더링하는 별도 과정이 필요하므로 직접 지원하지 않습니다.