PDF를 텍스트로 변환

PDF의 모든 텍스트를 TXT 파일로 뽑아 검색하고 편집하고 다시 활용하세요.

PDF에서 텍스트 추출 — 레이아웃 없는 내용만

필요한 것이 말뿐일 때가 있습니다. 계약서의 한 조항을 인용해야 하거나, 보고서를 스크립트에 넘겨야 하거나, 아주 긴 문서에서 숫자 하나를 찾아야 하거나, 설명서의 내용을 다른 시스템으로 옮겨야 할 때입니다. 그럴 때 PDF의 정성스러운 조판은 방해가 될 뿐입니다. 일반 텍스트로 추출하면 단, 머리글, 서식 없이 내용만 남고, 어떤 프로그램에서도 읽을 수 있는 파일이 됩니다.

PDF를 업로드하면 텍스트가 추출되어 TXT 파일로 저장되고 바로 내려받을 수 있습니다. 일반 텍스트에는 서식이 없어 결과물은 원본 문서에 비해 매우 작고, 메모장, TextEdit, 어떤 코드 편집기, 어떤 스크립트에서도 즉시 열립니다. 검색, 색인 작성, 다른 앱으로 복사, 자동 처리에 넣기에 알맞습니다.

중요한 제약이 하나 있습니다. 이 도구는 PDF 안에 저장된 텍스트 계층을 읽으므로 Word, Excel, 브라우저, 편집 프로그램에서 내보낸 문서에서 작동합니다. 종이를 스캔해 만든 PDF에는 글자가 아니라 페이지의 사진이 들어 있어 꺼낼 텍스트 계층이 없고 결과는 비어 있게 됩니다. 그 경우에는 문자 인식이 필요합니다. 서식과 함께 되찾고 싶다면 「PDF를 Word로」를 쓰세요. 서비스는 무료이며 처리 후 파일을 삭제합니다.

자주 묻는 질문

PDF에서 텍스트를 추출하려면?

이 페이지에서 문서를 업로드하고 만들어진 TXT 파일을 내려받으세요. 추출은 보통 몇 초면 끝납니다.

결과 파일이 비어 있는 이유는?

그 PDF는 거의 틀림없이 스캔본입니다. 스캔한 페이지는 텍스트가 아니라 텍스트의 이미지이므로 문자 인식 없이는 꺼낼 것이 없습니다.

서식이 유지되나요?

아니요, 의도적으로 그렇습니다. 일반 텍스트에는 서식이 없습니다. 글꼴도 단도 스타일도 없이 읽는 순서대로 단어만 얻습니다. 레이아웃이 필요하면 「PDF를 Word로」를 사용하세요.

표는 어떻게 되나요?

표의 내용은 텍스트로 추출되지만 표 자체의 격자는 일반 텍스트 파일로 표현할 수 없습니다. 쓸 수 있는 표가 필요하면 Word로 변환하세요.

어떤 인코딩을 쓰나요?

텍스트는 UTF-8로 저장됩니다. 모든 문자 체계를 지원하는 표준 인코딩이라 한글과 비라틴 문자도 올바르게 출력됩니다.

이 도구는 무료인가요?

네. 무료이고 가입도 하루 한도도 없으며 추출이 끝나는 대로 PDF는 서버에서 삭제됩니다.