24개 실용 가이드

문서 작업 가이드

글자 수 기준부터 자막 구조, 인코딩, PDF·HWP 추출 한계까지 결과가 달라지는 이유를 실제 사례로 설명합니다.

작업 기준을 먼저 확인하세요

24개 가이드
01

한국어 글자 수를 계산하는 방법

먼저 제출 기준이 공백·줄바꿈을 포함하는지 확인한 뒤 같은 기준으로 유니코드 문자를 세어야 합니다. 한국어 단어 수는 별도의 형태소 분석이 없다면 띄어쓰기 단위 참고값으로 보는 것이 정확합니다.

02

공백 포함 글자 수와 공백 제외 글자 수의 차이

공백 포함 값은 실제 입력된 간격과 줄바꿈까지 원고 분량으로 보고, 공백 제외 값은 스페이스·탭·줄바꿈 같은 공백 문자를 뺀 내용 중심 값입니다. 어느 값이 맞는지는 제출처의 정의로 결정합니다.

03

글자 수로 예상 읽기 시간을 계산하는 방법

공백 제외 글자 수를 독자에게 맞는 분당 글자 수로 나눈 뒤 초 단위로 환산하면 기본 예상 시간을 구할 수 있습니다. 표, 어려운 용어와 다시 읽는 시간은 별도로 여유를 두어야 합니다.

04

발표문과 내레이션의 예상 시간을 계산하는 방법

원고 글자 수를 실제 말하기 속도로 나누고 쉼표·문장 끝·슬라이드 전환의 휴지시간을 더하면 리허설 전 예상치를 만들 수 있습니다. 최종 길이는 반드시 직접 낭독해 보정해야 합니다.

05

복사한 PDF 문장의 불필요한 줄바꿈을 정리하는 방법

빈 줄로 구분된 문단은 남기고 문단 안에서 페이지 폭 때문에 생긴 줄바꿈만 공백으로 바꾸는 방식이 안전합니다. 표, 목록과 제목은 먼저 분리해 두어야 구조 손실을 줄일 수 있습니다.

06

중복된 목록과 문장을 빠르게 제거하는 방법

비교 전에 앞뒤 공백과 대소문자를 무시할지 정하고, 처음 또는 마지막 등장 중 어느 값을 보존할지 선택하면 원래 순서를 유지한 채 중복을 제거할 수 있습니다.

07

한글 목록을 가나다순으로 정렬하는 기준

한글 목록은 유니코드 코드값을 직접 비교하기보다 한국어 로캘의 Intl.Collator를 사용해야 자연스러운 가나다순에 가깝습니다. 숫자와 기호가 섞인 값은 별도 정렬 기준을 정해야 합니다.

08

UTF-8, EUC-KR과 CP949의 차이

새 파일은 폭넓은 문자 호환성을 가진 UTF-8이 일반적으로 적합합니다. 오래된 한국어 Windows 파일은 EUC-KR 또는 그 확장인 CP949일 수 있으므로 원본 바이트를 맞는 방식으로 먼저 읽은 뒤 UTF-8로 저장해야 합니다.

09

TXT와 CSV에서 한글이 깨지는 이유

파일을 저장한 인코딩과 여는 프로그램이 가정한 인코딩이 다르면 같은 바이트가 엉뚱한 문자로 해석됩니다. 원본을 덮어쓰지 말고 후보 인코딩별 미리보기를 비교해 올바르게 디코딩한 뒤 새 파일로 저장해야 합니다.

10

CSV와 TSV의 차이와 선택 방법

CSV는 쉼표, TSV는 탭으로 열을 구분합니다. 값에 쉼표가 자주 들어가면 TSV가 단순할 수 있고, 넓은 호환성이 중요하면 표준 인용 규칙을 지킨 CSV가 보통 유리합니다.

11

CSV를 JSON으로 변환할 때 확인할 점

헤더 이름, 구분자, 인용된 줄바꿈 셀과 빈 값 규칙을 먼저 확인한 뒤 숫자·불리언 자동 추정 여부를 결정해야 합니다. 우편번호처럼 표기 자체가 중요한 값은 문자열로 유지하는 편이 안전합니다.

12

JSON 정리와 압축의 차이

JSON 정리는 공백과 줄바꿈을 넣어 사람이 읽기 쉽게 만들고, 압축은 의미 없는 공백을 제거해 한 줄로 줄입니다. 둘 다 유효한 JSON이라면 객체와 배열의 데이터 의미는 바꾸지 않아야 합니다.

13

CSV를 Markdown 표로 변환하는 방법

CSV의 헤더와 필요한 열을 고른 뒤 각 셀의 파이프 문자와 줄바꿈을 이스케이프하고 헤더 구분 행을 만들면 Markdown 표가 됩니다. 병합 셀과 복잡한 서식은 단순 표로 줄여야 합니다.

14

SRT 자막 파일의 구조

SRT의 각 자막 블록은 순번, ‘시작 --> 종료’ 타임코드, 한 줄 이상의 대사와 빈 줄로 구성됩니다. 밀리초 앞에는 쉼표를 쓰며 시간 순서와 블록 구분이 올바른지 확인해야 합니다.

15

SRT와 WebVTT의 차이

SRT는 단순하고 널리 쓰이며 밀리초에 쉼표를 사용합니다. WebVTT는 WEBVTT 머리말, 점 밀리초와 위치·스타일 같은 웹 기능을 지원하므로 SRT로 바꿀 때 일부 정보가 사라질 수 있습니다.

16

자막 시간이 영상과 맞지 않을 때 조정하는 방법

처음부터 끝까지 같은 만큼 어긋났다면 모든 cue에 고정 오프셋을 더하거나 빼면 됩니다. 뒤로 갈수록 오차가 커진다면 재생 속도나 프레임 차이 문제라서 단순 시간 이동만으로 해결되지 않습니다.

17

자막의 초당 글자 수를 확인하는 이유

CPS는 자막 글자 수를 표시 시간(초)으로 나눈 값으로, 시청자가 읽어야 하는 속도를 찾는 참고 지표입니다. 적절한 기준은 언어·연령·콘텐츠·배포처마다 달라 사용자가 직접 정해야 합니다.

18

DOCX에서 텍스트만 추출할 때 유지되는 요소

일반 본문, 제목 스타일, 목록과 단순 표의 텍스트는 비교적 잘 추출되지만 페이지 배치, 글꼴, 글상자와 복잡한 표는 텍스트 형식에서 그대로 유지되지 않습니다.

19

PDF 텍스트 추출 결과의 줄 순서가 달라지는 이유

PDF는 문단 구조보다 페이지 좌표에 글자를 그리는 형식이어서 추출기가 위치를 바탕으로 읽기 순서를 추정합니다. 다단, 표와 개별 글자 배치가 많을수록 원문 순서와 달라질 수 있습니다.

20

HWP 문서에서 본문 텍스트를 추출하는 방법

확장자만 보지 말고 HWP 5.x 바이너리인지 HWPX 압축 XML인지 먼저 판별한 뒤, 섹션과 문단 레코드를 읽어 본문·표·각주 포함 범위를 정해야 합니다.

21

HWP를 Markdown으로 변환할 때 달라지는 요소

제목, 일반 문단, 강조, 목록과 단순 표는 Markdown에 옮길 수 있지만 페이지, 글꼴, 글상자, 다단, 복잡한 표와 수식은 단순화되거나 대체 문구·이미지로 바뀝니다.

22

HWP 간편 PDF와 원본 PDF 저장의 차이

간편 PDF는 추출한 문서 내용을 새 레이아웃으로 재구성한 읽기용 파일입니다. 한컴오피스의 PDF 저장은 원본 조판 엔진을 사용하므로 제출용이거나 배치 보존이 중요하면 원본 프로그램을 선택해야 합니다.

23

HWP와 HWPX 파일 형식의 차이

HWP 5.x는 복합 바이너리 스트림 기반이고 HWPX는 ZIP 안에 XML과 자원을 담은 개방형 구조입니다. 확장자만으로 판정하지 말고 시그니처와 내부 파일을 검사해 각각 맞는 파서를 사용해야 합니다.

24

문서 파일을 업로드하지 않고 브라우저에서 처리하는 원리

사용자가 직접 선택한 파일을 File API로 읽고 JavaScript·WebAssembly·Worker가 현재 기기에서 변환한 뒤 Blob과 Object URL로 내려받으면 업로드 서버 없이 문서를 처리할 수 있습니다.

추천 작업 흐름

처음부터 저장까지

  1. 1

    궁금한 작업 선택

  2. 2

    핵심 답변 먼저 확인

  3. 3

    사례와 단계별 기준 비교

  4. 4

    관련 도구에서 직접 실행

자주 묻는 질문

궁금한 점을 먼저 확인해 보세요

입력 내용은 어디에서 처리되나요?

도구의 계산과 파일 파싱은 현재 브라우저에서 실행됩니다. 파일을 받는 서버 API와 데이터베이스는 사용하지 않습니다.

다른 도구로 결과를 이어 보낼 수 있나요?

‘다른 도구에서 계속’을 누르면 결과 텍스트만 현재 탭의 sessionStorage에 임시 저장할 수 있습니다. 원본 파일은 저장하지 않습니다.

큰 파일도 처리할 수 있나요?

데스크톱과 모바일의 메모리 한도가 다릅니다. 각 도구에 표시된 권장 크기를 넘으면 브라우저가 느려지거나 탭이 종료될 수 있습니다.

변환 결과는 자동으로 저장되나요?

자동 저장하지 않습니다. 결과를 확인한 뒤 복사 또는 다운로드 버튼을 직접 눌러야 합니다.