콘텐츠로 건너뛰기

📄 PDF 텍스트 추출

PDF를 드래그 & 드롭하면 페이지별 텍스트 추출. 복사 또는 .txt 다운로드 가능. 브라우저 내 처리.

완전 무료 가입 불필요 브라우저 완결 5 개 언어 다크 모드

🔒 개인정보 보호

⚠ 스캔된 이미지 기반 PDF는 추출 불가 (OCR 필요). 텍스트 레이어가 있는 PDF만 지원.

📂

PDF 드래그 & 드롭 또는 클릭

📖 자주 걸리는 지점

pdf.js 를 사용해 PDF 에 포함된 텍스트 레이어를 페이지별로 꺼냅니다. 처리는 브라우저 안에서 끝나며 파일은 전송되지 않습니다. 꺼낼 수 있는 것은 문자로 기록된 정보뿐이며 단락 · 표 · 제목 같은 구조는 PDF 쪽에 존재하지 않습니다 — PDF 는 글자를 좌표에 놓는 그리기 명령의 모음이지 문서 구조를 갖는 형식이 아니기 때문입니다.

사례 무슨 일이 일어나는가 어떻게 하면 되는가
추출한 텍스트의 순서가 이상하다 PDF 의 내용은 이 위치에 이 글자를 그려라 라는 명령의 나열이며 읽는 순서는 보장되지 않습니다. 2단 조판 논문이라면 왼쪽 단과 오른쪽 단이 번갈아 섞이고 표라면 괘선이 사라져 셀 내용만 가로로 늘어섭니다. 머리말이나 쪽번호도 본문 중간에 끼어듭니다. 이는 추출의 실패가 아니라 PDF 에 순서 정보가 없다는 결과입니다. 먼저 레이아웃 유지를 켜 주세요 — Y 좌표가 가까운 글자를 묶어 한 줄로 복원하므로 다단 조판이라도 행 단위까지는 올바르게 늘어섭니다. 그런 다음 단은 눈으로 나눕니다. 표를 다루고 싶다면 텍스트 추출이 아니라 표 추출 방식으로 바꾸세요(Tabula · Camelot · pdftotext -layout 등). 열이 어긋나는 것은 너비 추정에 실패했을 뿐이므로 고정폭으로 출력한 뒤 열 위치에서 자르면 복원되는 경우가 있습니다.
글자가 깨진다 · 복사하면 다른 문자가 된다 PDF 는 폰트에 포함된 글리프 번호로 글자를 그립니다. 그 번호를 유니코드로 되돌리기 위한 대응표(ToUnicode CMap)가 포함되어 있지 않으면 추출 쪽은 올바른 문자를 복원할 수 없습니다. 작성 도구가 서브셋 임베딩을 했을 때 빠지기 쉬우며 화면에서는 정상으로 읽히는데 복사하면 의미 없는 문자열이 되는 것이 전형적인 증상입니다. 오래된 일본어 PDF 나 DTP 소프트웨어에서 내보낸 PDF 에서 자주 일어납니다. 추출 쪽에서는 고칠 수 없습니다. 다시 만들 수 있다면 폰트를 다시 임베딩해 내보내는 것이 유일한 근본책입니다. 손에 있는 것이 완성된 PDF 뿐이라면 그 페이지를 이미지로 내보내 OCR 에 거는 것이 실무상 가장 빠릅니다(OCR 도구). 깨짐 여부는 추출 결과를 몇 줄만 눈으로 읽으면 즉시 판별할 수 있으므로 전 페이지를 처리한 뒤에 알아차려 시간을 낭비하지 않도록 반드시 첫 페이지에서 확인하세요.
추출 결과가 0 자가 된다 종이를 스캔한 PDF 나 스마트폰으로 촬영해 PDF 로 만든 것은 페이지 전체가 한 장의 이미지이며 텍스트 레이어가 애초에 존재하지 않습니다. 글자가 보이기 때문에 알아차리기 어렵지만 파일의 내용은 사진과 같습니다. 관공서 배포 자료, 계약서 스캔, 오래된 종이 자료의 전자화 등은 거의 이에 해당합니다. OCR 로 넘기세요OCR 도구는 Tesseract 로 일본어와 영어를 인식하며 이 페이지와 마찬가지로 파일을 제3자에게 넘기지 않습니다. 판별은 간단해서 쪽수에 비해 추출 글자 수가 극단적으로 적다면(한 쪽당 몇 글자 이하) 스캔 PDF 입니다. 텍스트 쪽과 스캔 쪽이 한 파일에 섞여 있는 경우도 흔하므로 쪽별 글자 수 표시를 보고 0 자인 쪽만 OCR 로 넘기면 낭비가 없습니다.

추출할 수 있었다는 것과 써도 된다는 것은 다릅니다. PDF 에는 내용 추출 금지 라는 권한 플래그를 세울 수 있지만 이 플래그는 뷰어의 자율적인 운용이지 기술적인 보호가 아닙니다 — pdf.js 를 포함한 많은 구현은 무시합니다. 플래그가 없으니 자유롭게 써도 된다는 판단도 할 수 없습니다. 본문의 재배포나 번안의 가부는 어디까지나 원 자료의 저작권과 이용 조건으로 정해집니다. 또한 이 페이지의 처리는 모두 브라우저 안에서 끝나므로 대외비 PDF 를 읽어도 파일은 밖으로 나가지 않습니다. 다만 추출한 텍스트를 다른 서비스에 붙여 넣은 시점에 그 보장은 사라집니다.

📖 사용법

  1. 1
    PDF 불러오기
    PDF 드래그 또는 선택. pdf.js가 자동으로 추출.
  2. 2
    옵션 조정
    레이아웃 유지 · 페이지 번호 토글.
  3. 3
    복사 또는 다운로드
    클립보드 복사 또는 .txt 다운로드.

❓ 자주 묻는 질문

스캔된 PDF에서 추출 가능?
아니요. 이미지 PDF는 OCR 필요. 텍스트 레이어가 있는 PDF만 지원.
PDF가 서버에 전송됩니까?
아니요. pdf.js가 브라우저 내에서 처리.
레이아웃 유지와 차이는?
활성화 시 줄바꿈 · 공백 유지. 비활성화 시 단락으로 연결.
🐛 이 도구에서 문제가 발생했나요?

무료 · 가입 불필요. 재현 절차만이라도 도움이 됩니다. 보고는 운영자에게 직접 전달되어 개선에 사용됩니다.

※ 재현을 위해 브라우저 정보 (UA / 화면 / 언어 / URL) 가 자동 전송됩니다