먼저 알아둘 기준

HWP 5.x는 복합 바이너리 내부의 스트림과 레코드를 해석해야 하고 HWPX는 ZIP 안 XML 구조를 읽습니다. 같은 .hwp처럼 보여도 실제 시그니처가 다르면 잘못된 파서를 적용하지 않아야 합니다.

일반 문단은 비교적 순서대로 추출할 수 있지만 표, 글상자, 머리말과 각주는 별도 구조에 있을 수 있습니다. 사용 목적에 따라 표 텍스트와 부속 영역을 포함할지 옵션으로 정하는 것이 좋습니다.

암호화, DRM, 배포용 문서와 손상 파일은 파서가 읽지 못하거나 처리하면 안 되는 경우가 있습니다. 실패를 빈 결과로 숨기지 말고 실제 형식과 제한 이유를 알려야 합니다.

실제 작업에서 보는 사례

01

일반 HWP 5.x 보고서에서 문단과 단순 표의 텍스트를 TXT로 추출합니다.

02

HWPX 회의록은 압축 내부 section XML을 읽어 제목과 본문을 구성합니다.

03

확장자만 .hwp로 바꾼 다른 파일은 시그니처 불일치로 중단합니다.

단계별로 확인하는 방법

  1. 1

    사용 권한이 있는 원본을 복사해 브라우저에서 선택합니다.

  2. 2

    확장자, 파일 시그니처와 내부 구조로 HWP·HWPX를 판별합니다.

  3. 3

    표·머리말·꼬리말·각주·미주 포함 옵션을 정합니다.

  4. 4

    통계와 미지원 요소를 확인하고 결과를 새 TXT·Markdown으로 저장합니다.

주의할 점

  • 비밀번호나 DRM을 우회하려 하지 말고 지원하지 않는 보호 문서는 원본 프로그램에서 내보내야 합니다.
  • 추출된 순서와 원본의 시각적 배치가 다를 수 있으므로 중요한 숫자·표는 대조해야 합니다.

기술적 제한

  • HWP 바이너리 레코드와 HWPX XML 기능의 전체 사양을 브라우저 파서가 모두 구현하지 못할 수 있습니다.
  • 문서 스트림이 압축·암호화되었거나 손상되면 안전한 범위에서 본문을 복구하지 못할 수 있습니다.