PDF Excel 변환PDF 데이터 내보내기OCR PDF ExcelPower Query PDFAdobe Excel 내보내기

PDF 데이터를 Excel로 내보내는 방법: 완벽 가이드

Jennifer Walsh
Jennifer Walsh
프로젝트 매니저

Adobe, Power Query, OCR 및 타사 도구를 사용하여 PDF 데이터를 Excel로 내보내는 방법을 알아보세요. 문제 해결 팁과 데이터 정확도 검증 방법도 함께 다룹니다.

하도급업체가 스캔된 PDF 형식으로 입찰 내역서를 보냈습니다. 견적서를 발송하기 전에 수량, 단가, 합계 금액을 Excel로 정리해야 하므로, 내보내기를 실행하고 통합 문서를 엽니다. 행은 들어와 있지만 일부 헤더가 병합되어 있고, 몇몇 수량은 엉뚱한 항목 설명과 매칭되어 있으며, 숫자처럼 보이는 여러 금액을 Excel에서는 텍스트로 인식합니다. 데이터가 잘못되었다고 알려주는 경고는 어디에도 없습니다.

이것이 바로 PDF에서 Excel로 데이터를 내보내는 방법을 익힐 때 마주하는 난제입니다. 내보내기 버튼을 누르는 것은 대개 쉬운 일입니다. 어려운 부분은 PDF에 사용 가능한 구조가 포함되어 있는지 판단하고, 올바른 추출 방식을 선택하며, 제안서, 예산안, 청구서 검토, 또는 건설 적산(takeoff)에 사용되기 전에 통합 문서를 검증하는 것입니다.

PDF에서 Excel 내보내기가 소리 없이 실패하는 이유

PDF는 문서의 정보 구조보다는 시각적 형태를 유지하도록 설계되었습니다. 눈에 보이는 표도 실제로는 Excel이 이해할 수 있는 행과 열이 아니라 페이지 위에 배치된 텍스트 조각들로 구성되어 있을 수 있습니다. 이러한 차이 때문에 내보낸 결과물이 겉보기에는 그럴듯해 보여도 실제로는 잘못된 필드에 값이 들어가 있을 수 있습니다.

**디지털 원본 PDF(Native PDF)**에는 대개 선택 가능한 디지털 텍스트가 포함되어 있습니다. 반면 스캔된 PDF는 인쇄된 페이지의 이미지인 경우가 많으므로, 추출 도구가 단어와 숫자를 인식하려면 광학 문자 인식(OCR)이 필요합니다. 디지털 원본 파일이라 하더라도 여러 페이지에 걸친 표, 병합된 헤더, 불규칙한 간격, 회전된 페이지, 또는 반복되는 머리글/바닥글과 같은 페이지 요소가 포함되어 있으면 문제가 발생할 수 있습니다.

Excel 파일이 표시된 노트북 옆에서 손상된 데이터가 인쇄된 스프레드시트를 들고 있는 사람.

깔끔해 보이는 통합 문서 뒤에 숨겨진 오류들

시공업체가 기성내역서(schedule of values)를 내보내 Excel에서 모든 세부 항목을 확인할 수도 있습니다. 하지만 위험한 오류는 눈에 띄기보다는 구조적인 문제인 경우가 많습니다.

  • 병합된 헤더: 여러 열에 걸쳐 있는 머리글로 인해 추출 도구가 하위 머리글을 일관되지 않게 할당할 수 있습니다.
  • 밀려난 열: 한 행에서 누락된 값이 발생하면 그 뒤의 모든 값이 한 열씩 좌우로 밀릴 수 있습니다.
  • 텍스트 형식의 숫자: 숫자처럼 보이는 금액이 수식, 정렬, 필터에서 올바르게 작동하지 않습니다.
  • 깨진 행 구분: 여러 줄로 넘어가는 항목 설명이 별도의 행으로 분리될 수 있습니다.
  • 반복되는 페이지 콘텐츠: 머리글과 바닥글이 데이터 세트 중간에 삽입될 수 있습니다.
  • 잘못 인식된 문자: 특히 품질이 낮은 스캔본의 경우 OCR이 숫자, 구두점, 기호, 문자를 혼동할 수 있습니다.

PDF 표 추출 오류에 대한 Adobe 지침에서는 원본을 감사하고 변환 후 서식을 점검할 것을 권장합니다. 스프레드시트는 기본 행 매핑이 잘못되었더라도 아무런 경고 없이 계산을 수행할 수 있기 때문에 이 조언은 매우 중요합니다.

실무 원칙: 내보낸 통합 문서가 단순히 잘 열린다고 해서 승인하지 마십시오. PDF 원본과 대조하여 구조, 값, 합계를 철저히 확인한 후에만 승인해야 합니다.

견적 산출 팀에게 이러한 문제는 즉각적인 피해로 이어질 수 있습니다. 치수, 품목 수량, 자재량이 잘못 전달되면 적산(takeoff)과 제안서 전체에 오류가 전파됩니다. 재무 팀 역시 청구서, 명세서, 보고서 등에서 동일한 위험에 직면합니다. 스프레드시트가 문서화된 품질 검사를 통과할 때까지는 PDF를 신뢰할 수 없는 원본으로 간주하십시오.

Adobe Acrobat 및 Excel 기본 기능을 활용한 방법

깔끔하게 디지털로 생성된 PDF의 경우 내장 도구를 사용하는 것이 합리적인 출발점입니다. Adobe Acrobat은 직접 내보내기 워크플로를 제공하며, Excel은 Power Query를 통해 감지된 표를 가져올 수 있습니다. 두 방법 모두 검토 과정을 생략할 수는 없지만, 원본 레이아웃이 단순할 때는 작업 시간을 크게 단축할 수 있습니다.

Adobe Acrobat으로 내보내기

Adobe의 현재 워크플로는 간단합니다:

  1. Acrobat에서 PDF를 엽니다.
  2. PDF 내보내기를 선택합니다.
  3. 스프레드시트를 선택합니다.
  4. **Microsoft Excel 통합 문서(.xlsx)**를 선택합니다.
  5. 출력 파일을 저장합니다.
  6. 통합 문서를 열고 값을 수정하기 전에 추출된 시트를 점검합니다.

Acrobat은 XLSX 및 XML 형식으로의 내보내기도 지원하며, 표마다, 페이지마다, 또는 전체 문서 단위로 워크시트를 생성하도록 설정할 수 있습니다. 페이지마다 일관된 표가 있는 보고서의 경우, 워크시트 분할 설정에 따라 생성된 통합 문서의 필터링 및 대사 작업 편의성이 달라집니다.

이 워크플로는 수년 동안 거의 동일하게 유지되어 왔습니다. Adobe의 현재 PDF-Excel 변환 안내는 위와 같은 내보내기 방식을 안내하고 있으며, 2009년 문서화된 내보내기 워크플로에서도 이미 스프레드시트 저장, 스캔된 PDF를 위한 OCR, Excel에서 표 데이터 열기 등의 방식을 설명한 바 있습니다. 이러한 지속성 덕분에 Acrobat은 익숙한 데스크톱 또는 웹 기반 변환 경로가 필요한 사용자에게 실용적인 선택지입니다.

Acrobat은 PDF에 선택 가능한 텍스트가 있고, 열 구조가 일정하며, 레이아웃 변화가 적을 때 가장 유용합니다. 문서가 이미지 형식이거나 수기 마크업이 포함되어 있거나, 한 파일 내에 여러 표 디자인이 혼재된 경우에는 신뢰도가 떨어집니다.

150부터 300 DPI까지 다양한 문서 유형 및 해상도에 따른 OCR 정확도 백분율을 비교하는 막대형 차트.

Excel Power Query를 통한 데이터 가져오기

Excel의 내장 가져오기 기능을 사용하면 프로그램이 감지한 내용을 더 자세히 파악할 수 있습니다:

  1. Excel을 열고 통합 문서를 새로 만들거나 기존 문서를 엽니다.
  2. 데이터로 이동합니다.
  3. 데이터 가져오기, 파일에서, PDF에서를 차례로 선택합니다.
  4. PDF를 선택하고 가져오기를 클릭합니다.
  5. 감지된 표와 페이지가 표시되는 탐색 창 패널을 검토합니다.
  6. 표를 선택하고 로드를 누르거나, 데이터 변환을 선택하여 Power Query에서 먼저 데이터를 정제합니다.

Power Query는 반복되는 머리글을 제거하고, 데이터 형식을 변경하며, 열을 분할하고, 바닥글을 필터링하거나 결과를 로드하기 전에 여러 표를 결합해야 할 때 유용합니다. 워크시트에서 모든 셀을 일일이 수동으로 수정하는 대신, 반복 적용 가능한 변환 레이어를 제공합니다.

단점은 Power Query가 감지된 정보만을 기반으로 작동한다는 점입니다. 원본에 신뢰할 만한 표 구조가 없으면 미리보기가 불완전하거나 조각날 수 있습니다. 또한 자체적으로 OCR 문제를 해결하지 못하므로, 스캔된 문서는 Excel에서 내용을 처리하기 전에 별도의 문자 인식 단계를 거쳐야 합니다.

깔끔한 PDF에서 빠르게 내보내려면 Acrobat을 사용하십시오. 정밀한 정제, 반복 가능한 변환 작업, 또는 감지된 여러 표를 체계적으로 처리해야 할 때는 Power Query를 사용하십시오. 두 경우 모두 원본 PDF는 그대로 보존하고 별도의 작업 파일로 내보내야 합니다.

OCR 정확도 및 스캔된 PDF에 추가 작업이 필요한 경우

스캔된 PDF는 도구가 표를 직접 읽는 것이 아니기 때문에 다른 방식으로 접근해야 합니다. 픽셀로부터 이미지를 해석하여 텍스트를 재구성하는 것이기 때문입니다. 스캔 품질, 대비, 기울기, 압축률, 손글씨, 도장, 배경 노이즈 등이 모두 결과에 영향을 미칩니다.

안정적인 워크플로는 원본 준비에서 시작됩니다. PDF 추출을 위한 기술적 OCR 워크플로 지침에 따르면 300 DPI 이상의 페이지 이미지로 작업하고, OCR을 실행한 뒤, 인식된 텍스트를 스프레드시트 구조로 파싱하는 것을 권장합니다. 저해상도 이미지는 인식 품질을 크게 떨어뜨리므로, 아무리 정교한 내보내기 도구를 쓰더라도 조악한 원본 품질을 보완할 수는 없습니다.

정확도 범위를 판단 기준으로 활용하기

벤치마크 범위는 파일에 얼마만큼의 검토가 필요한지 결정할 때 유용한 기준이 됩니다. 동일한 문서 유형별 OCR 벤치마크에 따르면, 디지털 PDF는 약 97%~99.5%의 필드 정확도에 도달할 수 있지만, 손글씨가 있거나 노이즈가 심한 문서는 약 60%~85% 수준으로 떨어질 수 있습니다.

이러한 수치가 모든 워크플로의 절대적인 승인 기준은 아닙니다. 다만 깔끔하게 인쇄된 내역서는 자동화 보조 처리에 적합할 수 있는 반면, 수기로 작성된 현장 보고서나 손상된 구형 스캔본은 집중적인 검증이 필요한 이유를 명확히 보여줍니다. 수량이나 치수에서 발생하는 한 글자의 작은 오류는 수많은 단어가 정확히 인식된 것보다 훨씬 더 치명적일 수 있습니다.

별도의 2026년 PDF-Excel 변환 정확도 비교 자료에 따르면, 성능이 우수한 도구를 사용했을 때 선명한 300 DPI 스캔본은 약 92%~98%, 일반적인 스캔본은 약 80%~93%, 품질이 낮은 스캔본은 엔진에 따라 약 **45%~80%**의 정확도를 보였습니다. 여기서 중요한 점은 편차가 매우 크다는 사실입니다. 소프트웨어 선택만큼이나 문서의 상태가 결과에 결정적인 영향을 미칩니다.

추출 전 전처리 수행하기

OCR을 시작하기 전에 전체 파일을 곧바로 변환으로 넘기지 말고 페이지를 먼저 살펴보십시오.

  • 방향 확인: 텍스트 방향이 일관되도록 거꾸로 되거나 옆으로 누운 페이지를 회전합니다.
  • 가독성 개선: 그림자, 도장, 압축 등으로 문자가 흐릿한 경우 더 선명한 스캔본을 사용합니다.
  • 문서 유형 분리: 서로 다른 추출 규칙이 필요한 내역서, 도면 마크업, 증빙 페이지 등을 별도로 분리합니다.
  • 해상도 확인: 기술 가이드에서 제시하는 기준치인 300 DPI를 확보합니다.
  • 손글씨 식별: 손글씨 필드는 인쇄된 텍스트처럼 처리하지 말고 수동 검증 대상으로 표시합니다.

OCR이 완료되면 대표 행들을 원본과 비교하십시오. 건설 관련 문서라면 수량, 치수, 품목 식별 코드, 합계 금액을 가장 먼저 확인해야 합니다. 재무 문서라면 날짜, 소수점 위치, 계정 참조 번호, 금액을 점검하십시오.

파일을 내보낸 후 데이터 무결성을 보장하기 위한 5가지 필수 단계를 설명하는 내보내기 후 검증 체크리스트 인포그래픽.

배관 견적 소프트웨어에 연동해야 하는 통합 문서 역시 다른 금융 데이터 입력과 마찬가지로 철저하게 검토해야 합니다. OCR은 데이터 추출을 돕는 보조 수단일 뿐, 모든 셀이 정확하다는 보증이 아닙니다.

복잡한 표를 위한 서드파티 도구 및 Power Query

기본 제공 변환 도구는 원본이 깔끔하고 예측 가능할 때 잘 작동합니다. 복잡한 문서는 보다 신중한 선택이 필요합니다. 다중 행 머리글, 중첩된 표, 불규칙한 간격, 워터마크, 페이지 회전, 혼재된 필기체 등은 사람이 보기에 읽기 쉬운 페이지라 하더라도 단순한 내보내기 기능을 무력화할 수 있습니다.

기본 표가 이미 감지 가능한 상태라면 Power Query가 가장 강력한 옵션인 경우가 많습니다. 행을 머리글로 승격하고, 불필요한 행을 제거하며, 데이터 형식을 변경하고, 필드를 분할하며, 반복되는 페이지 요소를 필터링하고, 반복 가능한 데이터 변환을 통해 결과물을 결합할 수 있습니다. 이는 레이아웃이 일정한 반복 보고서에 매우 유용합니다.

전용 표 추출 도구는 표 영역을 직접 지정하거나, 특정 열을 보존해야 하거나, Excel로 가져오기 전에 CSV와 같은 형식으로 구조화된 데이터를 내보내야 할 때 더 유용합니다. OCR 중심 플랫폼은 입력 파일이 스캔되었거나, 작업이 주기적으로 반복되거나, 인식 및 필드 매핑이 필요한 복합 레이아웃이 문서에 포함되어 있을 때 더 적합합니다.

방식추천 대상정확도 범위한계점
Adobe Acrobat 내보내기깔끔한 디지털 원본 PDF 및 일회성 통합 문서원본 품질 및 레이아웃에 따라 다름복잡한 표에서 오류가 발생할 수 있으며 검토가 필요함
Excel Power Query반복적인 정리가 필요한 감지된 표감지된 구조에 따라 다름OCR을 대체할 수 없으며 까다로운 페이지는 분할될 수 있음
전용 표 추출 도구선택된 표 영역 및 구조화된 디지털 원본 PDF원본 품질 및 추출 엔진에 따라 다름수동 표 선택 및 미세 조정이 필요할 수 있음
OCR 또는 문서 처리 도구스캔된 파일 및 반복적인 복합 문서 워크플로보고된 벤치마크 자료에 따르면 필기체 또는 노이즈가 있는 문서는 약 60%~85%, 디지털 PDF는 최대 약 97%~99.5%인식 결과에 대한 검증이 여전히 필요하며 사람의 검토가 요구될 수 있음
CSV 우선 워크플로다운스트림 로드가 간편해야 하는 단순하고 평면적인 데이터 세트추출 품질에 따라 다름통합 문서 서식이 손실되며 복잡한 관계를 보존하지 못할 수 있음

문서 복잡성에 따른 선택

평면적인 데이터 교환이 필요하고 표의 구조적 복잡성이 거의 없을 때는 CSV를 사용하십시오. 시각적 서식보다 데이터 변환과 반복 작업이 더 중요할 때는 Power Query를 사용하십시오. 문서가 스캔되었거나 일관되지 않은 파일들이 반복적으로 유입되어 처리해야 할 때는 전용 OCR 도구를 사용하십시오.

인허가 도면 세트, 하도급업체 마크업, 오래된 스캔본의 경우 수동 정리가 여전히 올바른 결정일 수 있습니다. 분량이 적고 중요도가 높은 파일은 그럴듯하지만 정렬이 어긋난 행을 생성하는 자동화 파이프라인에 억지로 밀어넣는 것보다 직접 검토하는 것이 훨씬 안전한 경우가 많습니다.

건설 팀이 문서 검토나 견적 산출 워크플로를 비교해야 할 때, 이 Bluebeam 비교 자료와 같은 전문 자료는 단순한 내보내기 형식이 아니라 실제 수행 중인 업무를 중심으로 선택 기준을 세우는 데 도움이 됩니다. 올바른 도구란 추적 가능하고 검토 가능한 결과를 남겨주는 도구입니다.

내보내기 후 검증 및 데이터 정리 체크리스트

내보낸 통합 문서는 검증을 통과하기 전까지는 작업용 초안에 불과합니다. 먼저 원본 결과물을 그대로 저장한 다음, 별도의 사본에서 수정을 진행하십시오. 그래야 감사 추적(audit trail)이 가능해지고 정제된 데이터를 원본 페이지와 비교할 수 있습니다.

값보다 구조를 먼저 확인

시트를 위에서 아래로 검토하며 PDF와 레이아웃을 비교하십시오. 중복된 머리글, 누락된 행, 잘못 배치된 바닥글, 병합된 열, 페이지 간 열 순서 변경 여부 등을 확인합니다. 여러 페이지에 걸친 표가 원래 연속되어야 하는 경우, 두 번째 페이지가 잘못 정렬된 새 표로 시작되지 않고 올바른 필드로 이어지는지 확인하십시오.

그런 다음 데이터 형식을 점검하십시오. 텍스트로 내보내진 숫자는 계산을 방해하는 공백, 통화 기호, 줄 바꿈 없는 공백(nonbreaking space) 또는 문장 부호를 포함하는 경우가 많습니다. 보조 열에서 =VALUE(A2)를 사용하면 깔끔한 숫자 문자열을 변환할 수 있으며, **텍스트 나누기(Text to Columns)**를 사용하면 텍스트로 입력된 값을 분리하거나 정규화하는 데 도움이 됩니다. 겉보기에 성공적으로 변환된 것처럼 보여도 숨겨진 문자가 남아 있을 수 있으므로 변환 후 셀 서식을 확인하십시오.

통합 문서 대사(Reconcile)

눈에 보이는 합계 하나에만 의존하지 말고 독립적인 교차 검증을 활용하십시오.

  • 행 개수 비교: 반복되는 머리글이나 바닥글 줄을 제외하고 예상되는 데이터 행의 수를 계산합니다.
  • 합계 재계산: 정제된 금액 또는 수량 열에 SUM을 사용하여 계산한 결과를 PDF의 합계와 비교합니다.
  • 빈 셀 확인: 원본에 값이 있는 주요 열에서 비어 있는 셀이 있는지 필터링합니다.
  • 극단값 점검: 수량과 금액을 정렬하여 잘못 찍힌 소수점이나 예상치 못한 텍스트를 찾아냅니다.
  • 수식 검토: 정리 작업 후 수식이 의도한 행과 열을 참조하고 있는지 확인합니다.

PDF 추출 오류 가이드에서는 특히 셀 서식, VALUE, 텍스트 나누기, 구조 보존 추출 등을 실질적인 안전장치로 제시하고 있습니다. 이러한 점검은 빠르게 진행할 수 있으면서도 단순한 육안 검토를 빠져나갈 수 있는 오류들을 잡아냅니다.

정확하고 일관된 데이터 전달을 보장하기 위한 '내보내기 후 검증 및 데이터 정리 체크리스트' 제목의 체크리스트 인포그래픽.

마지막으로 변경 사항을 문서화하십시오. 팀에서 내보낸 PDF를 잠재 고객이나 공급업체 레코드와 결합하는 경우, 일관되고 신뢰할 수 있는 리드 추출 방법을 활용하면 더 광범위한 스프레드시트 워크플로에 입력하기 전에 원본 데이터를 체계적으로 관리하는 데 도움이 됩니다. 원칙은 동일합니다. 원본을 보존하고, 데이터 변환 과정을 기록하며, 검토 책임을 명확히 하는 것입니다.

문서에 적합한 워크플로 선택하기

먼저 세 가지 질문으로 시작하십시오. "PDF가 디지털 원본인가요, 아니면 스캔본인가요? 표가 단순한가요, 아니면 복잡한가요? 이후 Excel 데이터는 어떻게 활용되나요?" 가벼운 분석에 사용되는 깔끔한 디지털 원본 표는 일반적으로 Acrobat이나 Excel을 통해 처리할 수 있습니다. 견적 산출에 사용되는 스캔된 일정표나 내역서는 OCR 준비와 문서화된 검토 과정을 거쳐야 마땅합니다. 일관성이 없는 파일들이 반복해서 들어오는 경우라면 사람의 검증이 포함된 전용 추출 워크플로를 도입하는 것이 합당할 수 있습니다.

건설 팀의 경우 모든 PDF 페이지를 단순한 데이터 추출 문제로 취급해서는 안 됩니다. 도면은 축척, 기호, 면적, 선형 치수를 이해하는 적산 플랫폼으로 처리하는 것이 더 나을 수 있는 반면, 기성내역서는 Acrobat이나 Power Query에 더 적합할 수 있습니다. 예를 들어 Exayard를 사용하면 건설 분야 사용자가 PDF나 이미지 도면을 업로드하여 적산 및 견적 산출 결과를 생성하고, 해당 결과를 Excel, PDF 또는 CSV로 내보낼 수 있습니다. 지붕 공사 문서를 다루는 팀은 워크플로 평가의 일환으로 지붕 견적 산출 소프트웨어를 검토해 볼 수도 있습니다.

문서 유형에 맞춰 반복 가능한 프로세스를 구축하십시오. 원본 상태를 기록하고, 추출 방식을 선택하며, 원본을 보존하고, 결과물을 검증하며, 불확실한 페이지는 사람의 검토 대상으로 표시하십시오. 핵심은 도구가 파일을 내보낼 수 있느냐가 아닙니다. 생성된 스프레드시트가 신뢰할 수 있는 이유를 팀에서 명확히 설명할 수 있느냐입니다.


Exayard는 건설 팀이 PDF 및 이미지 도면을 Excel, PDF 또는 CSV로 내보낼 수 있는 구조화된 건설 적산 및 견적 산출 데이터로 변환할 수 있도록 지원합니다. 현재 도면에서 수량을 복사한 후 모든 줄을 수동으로 확인하는 방식으로 작업하고 있다면, Exayard를 방문하여 도면에서 제안서용 데이터까지 이어지는 보다 반복 가능하고 안정적인 프로세스를 확인해 보십시오.