◼️ 1. 핵심 기능 및 특징
OCR 및 손글씨 인식 (Detect Document Text)
인쇄된 텍스트뿐만 아니라 필기체(손글씨)까지 높은 정확도로 감지한다. 텍스트는 단어(Word)와 줄(Line) 단위로 블록(Block)화되어 추출된다.
폼 데이터 추출 (Key-Value Pairs)
신청서나 설문지처럼 '이름: 홍길동', '생년월일: 1990-01-01'과 같이 키-값 형태로 묶인 필드를 자동으로 감지하고 관계를 매핑한다. 서식의 형태가 조금씩 달라져도 문맥을 분석해 정확한 값을 찾아낸다.
테이블(표) 구조 분석
행(Row)과 열(Column)로 구성된 복잡한 표를 인식해 각 셀(Cell)의 위치와 병합 관계를 유지한 채 데이터를 추출한다. 재무제표나 명세서 같은 표 데이터를 엑셀이나 데이터베이스 포맷으로 손쉽게 변환할 수 있다.
레이아웃 분석 (Layout)
제목, 문단, 머리글, 바닥글, 리스트 항목 등 문서의 시각적 계층 구조를 파악해 텍스트를 구조화한다.
자연어 쿼리 (Queries)
AnalyzeExpense: 영수증과 청구서(Invoice)에 특화되어 품목(Line item), 공급업체, 총액, 세금 등을 라벨링하여 추출한다.AnalyzeID: 여권, 운전면허증 등 공식 신분증 서식을 분석해 이름, 만료일 등을 추출한다.Analyze Lending: 대출 서류 묶음(모기지 패키지 등)을 자동 분류하고 분할 처리한다.
서명 감지 (Signature Detection)
문서 내에서 알고 싶은 내용을 "총 결제 금액이 얼마인가?"와 같이 자연어로 질문하면 해당 답변 영역을 직접 찾아 반환한다.
특화 API 제공
문서 내에 서명이 존재하는지 여부와 위치를 바운딩 박스로 식별한다.
◼️ 2. 작동 방식과 데이터 구조
Textract는 처리 결과를 JSON 구조의 Block 객체 배열로 반환한다. 각 블록은 추출된 텍스트 내용 외에도 다음의 메타데이터를 포함한다:
BoundingBox & Polygon: 문서 내 해당 텍스트나 객체의 정확한 좌표 정보다.
Confidence Score: 해당 인식 결과에 대한 신뢰도 점수(0~100)를 제공해, 임계값 이하의 데이터는 검수 단계로 넘길 수 있다.
Relationships: 키와 값, 표와 셀 등 연관된 상·하위 블록 간의 ID 연결 정보를 제공한다.
처리 모드는 단일 페이지의 즉각적인 처리를 위한 동기(Synchronous) API와 다중 페이지 PDF 등 대용량 처리를 위한 비동기(Asynchronous) API를 모두 지원한다. 비동기 작업은 S3 버킷에 저장된 문서를 지정하여 작업을 시작한 뒤 Amazon SNS나 SQS를 통해 완료 알림을 받아 처리 결과를 수신하는 구조를 취한다.
◼️ 3. 주요 장점과 고려사항
장점: 복잡한 머신러닝 모델을 직접 학습시키거나 유지보수할 필요 없이 API 호출만으로 최신 딥러닝 기반 문서 분석 기능을 도입할 수 있다. 기존의 룰 기반 OCR과 달리 양식이 변경되거나 회전·기울어짐이 발생해도 안정적인 추출률을 보인다. Amazon Augmented AI(A2I)와 결합하면 신뢰도가 낮은 결과에 대해 사람의 수동 검토 워크플로우를 즉시 연계할 수 있다.
고려사항: 라틴 문자 기반 언어와 주요 서양권 언어에 최적화되어 발전해 왔으므로, 한국어(한글) 추출 정확도 및 특정 서식 지원 범위에 대해서는 실제 도입 전 지원 언어 목록과 인식률을 검증하는 과정이 필요하다. 또한 비용은 처리된 페이지 수와 호출한 분석 기능(기본 OCR, 표, 폼, 쿼리 등)에 따라 종량제로 부과되므로 대규모 파이프라인 설계 시 비용 최적화가 요구된다.
◼️ 4. 지원언어
Amazon Textract는 기본적으로 한국어(및 일본어 등 CJK 언어)를 지원하지 않는다. 영어, 스페인어, 독일어, 프랑스어, 이탈리아어, 포르투갈어 등 라틴 기반 문자를 주로 지원하기 때문에 한국어, 일본어 문서를 넣으면 문자가 완전히 깨지거나 무작위 특수문자/영어 알파벳으로 오인식된다.
AWS 생태계 내에서 해결하거나 대체할 수 있는 방법은 다음과 같다.
Google Cloud Vision API 사용
일본어 인쇄물 및 손글씨, 특히 세로쓰기(縦書き) 문서에 대해서는 Google Cloud Vision API의 인식률이 업계 표준 수준으로 가장 안정적이다.
◼️ 5. 비용
한 페이지에 대해 여러 기능을 동시에 요청하면 각 기능의 단가가 합산되어 청구된다.
예시 1: 계약서 1페이지에서 단순 텍스트만 추출 (
Detect Document Text)$\rightarrow$ $0.0015 청구
예시 2: 1페이지 안에서 '표(Tables)'와 '폼(Forms)'을 동시에 추출
$\rightarrow$ Tables($0.015) + Forms($0.050) = 페이지당 $0.065 청구
(1만 장 처리 시 약 $650로 비용이 급격히 증가한다.)
무료 사용량 (AWS 프리 티어)
AWS 신규 계정 가입 시 최초 3개월간 매월 다음의 무료 사용량이 제공된다.
Detect Document Text: 매월 1,000페이지 무료Analyze Document(Tables, Forms, Queries 각각): 매월 100페이지 무료AnalyzeExpense: 매월 100페이지 무료AnalyzeID: 매월 100페이지 무료
| 분석 기능 (API) | 주요 대상 | 페이지당 단가 (USD) |
| Detect Document Text | 기본 인쇄체/손글씨 텍스트 추출 | $0.0015 (1,000장당 약 $1.5) |
| Analyze Document (Tables) | 표(테이블) 구조 및 셀 데이터 추출 | $0.015 (1,000장당 약 $15) |
| Analyze Document (Forms) | 키-값(Key-Value) 필드 추출 | $0.050 (1,000장당 약 $50) |
| Analyze Document (Queries) | 자연어 질문으로 특정 값 추출 | $0.015 (1,000장당 약 $15) |
| Analyze Document (Signatures) | 서명 유무 및 위치 감지 | $0.0035 (1,000장당 약 $3.5) |
| Analyze Document (Layout) | 제목, 문단 등 레이아웃 구조화 | $0.0035 (1,000장당 약 $3.5) |
| AnalyzeExpense | 영수증 및 인보이스(청구서) 특화 | $0.01 (1,000장당 약 $10) |
| AnalyzeID | 여권, 운전면허증 등 신분증 특화 | $0.025 (1,000장당 약 $25) |
* 이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.