음성인식은 정확도만으로 설명되지 않습니다

기업 환경에서 음성인식 엔진의 품질은 왜 정확도 숫자 하나로 설명되지 않을까. 현장에서 반복되는 문제를 중심으로 HAIV가 보는 기업용 음성 AI의 조건을 풀어봅니다.

기업 현장에서 음성인식 엔진을 쓰다 보면 이상한 순간을 자주 만납니다. 전체 문장은 잘 받아 적는데 사람 이름 하나가 계속 틀리고, 데모에서는 빨랐는데 실제 회의에서는 결과가 늦어집니다. 이런 문제는 모델 정확도 하나로는 설명되지 않습니다.

HAIV Speech AI Engine 정확도 · 도메인 · 실시간성 · 배포 환경

음성인식 도입을 검토할 때 가장 먼저 묻는 질문은 대개 같습니다. “정확도가 몇 퍼센트인가요?” 그런데 실제 운영을 시작하면 이 질문은 오래 가지 않습니다. 대신 “왜 우리 상품명만 자꾸 틀리죠?”, “왜 긴 회의에서는 중간부터 흔들리죠?”, “이 데이터를 외부로 보내도 되나요?” 같은 질문이 남습니다.

Observation 01

문제는 전체 정확도가 아니라, 틀리는 위치에서 시작됩니다

일상적인 문장은 대부분의 음성인식 엔진이 꽤 잘 알아듣습니다. 차이는 오히려 빈도가 낮은 단어에서 드러납니다. 사람 이름, 회사명, 상품명, 사내 약어, 금융·보험·공공 분야의 전문용어 같은 것들입니다.

이런 단어는 전체 발화에서 차지하는 비중은 작습니다. 그래서 평균 정확도에는 큰 영향을 주지 않을 수 있습니다. 하지만 실제 문서를 읽는 사람에게는 가장 먼저 눈에 들어옵니다.

평균 정확도는 좋아졌는데
문서가 여전히 “못 쓰겠다”고 느껴진다면,
틀리는 단어의 종류부터 봐야 합니다.
01 · LOW FREQUENCY

자주 나오지 않습니다

학습 데이터에서 보기 어려운 인명·상품명은 모델이 상대적으로 낮은 확률을 줄 수 있습니다.

02 · HIGH IMPACT

틀리면 바로 보입니다

조사 하나보다 이름 하나의 오인식이 문서 신뢰도에 훨씬 큰 영향을 줍니다.

03 · DOMAIN DEPENDENT

회사마다 다릅니다

어떤 단어가 중요한지는 범용 모델이 아니라 실제 업무 도메인이 결정합니다.

Observation 02

그래서 기업용 음성인식은 '우리 말'을 알아야 합니다

HAIV에는 인명, 지명, 전문용어를 미리 등록할 수 있는 사용자 사전이 있습니다. 이 기능의 의미는 단순히 단어 목록을 추가하는 데 있지 않습니다. 실제로는 범용 언어 모델이 모르는 업무 맥락을 인식 과정에 넣는 것에 가깝습니다.

음성 입력 회의 · 상담 · 자막 HAIV STT 후보 문장 생성 사용자 사전 인명 · 상품명 · 전문용어 후보 선택 박서현 박서연 ↑ 업무 맥락 반영 Text Result
범용 모델이 놓치기 쉬운 단어를 업무 맥락에 맞춰 후보 선택 과정에서 살려주는 것이 사용자 사전의 역할입니다.
사용자 사전은 단어를 많이 넣는 기능이라기보다, 회사마다 다른 언어 환경을 엔진에 알려주는 장치라고 보는 편이 정확합니다.
Observation 03

정확도를 높이려다 오히려 문장이 나빠질 수도 있습니다

전문용어를 많이 등록하면 당연히 결과가 좋아질 것 같지만, 실제로는 그렇지 않습니다. 비슷한 발음의 단어가 많아질수록 후보끼리 경쟁하고, 특정 단어를 지나치게 강하게 밀면 일반 단어까지 전문용어로 잘못 적히기 시작합니다.

그래서 사용자 사전의 품질은 목록의 크기가 아니라 선별과 표기, 그리고 강도의 균형에서 나옵니다. 실제 업무에서 쓰는 단어만 남기고, 한글/영문 표기를 통일하고, 지나치게 짧고 모호한 단어는 빼는 작업이 중요합니다.

음성인식에서 “더 많이 넣는 것”보다 어려운 일은
“무엇을 빼야 하는지 결정하는 것”입니다.
Observation 04

실시간 서비스에서는 '잘 알아듣는가'만큼 '언제 보여주는가'가 중요합니다

회의 파일을 업로드하고 나중에 결과를 받는 환경과, 말하는 순간 화면에 텍스트가 나와야 하는 환경은 같은 음성인식이 아닙니다. 실시간 회의록이나 상담 자막에서는 몇 초의 지연도 사용 경험을 바꿉니다.

이때는 정확도뿐 아니라 latency, 부분 결과의 안정성, 동시 세션 수, 긴 발화에서의 처리 안정성을 함께 봐야 합니다. 데모 파일 하나에서 잘 돌아가는 것과 실제 업무 시간 동안 계속 돌아가는 것은 다른 문제입니다.

01 · LATENCY

얼마나 빨리 보이는가

사용자가 말한 뒤 결과가 화면에 나타나는 시간입니다.

02 · STABILITY

결과가 얼마나 흔들리는가

중간 결과가 반복해서 바뀌면 실시간 사용성이 크게 떨어집니다.

03 · THROUGHPUT

동시에 얼마나 처리하는가

실제 운영에서는 단일 파일보다 동시 접속과 장시간 처리 능력이 중요합니다.

Observation 05

기업에서 음성 AI를 고를 때 마지막에 남는 질문은 보안입니다

회의, 상담, 공공 기록에는 외부로 보내기 어려운 데이터가 많습니다. 그래서 기업용 음성 AI에서는 “어떤 기능이 있느냐”만큼 “어디에서 동작하느냐”가 중요합니다.

클라우드가 적합한 업무도 있고, 사내 서버나 폐쇄망 안에서만 처리해야 하는 업무도 있습니다. 결국 배포 방식은 기술 선택이 아니라 데이터 정책의 문제와 연결됩니다.

기업용 음성 AI는 모델을 고르는 일이 아니라,
업무 언어와 운영 환경을 함께 설계하는 일에 가깝습니다.
Observation 06

STT는 결과가 아니라, 다음 업무의 시작점입니다

회의에서는 음성인식 다음에 화자 분리와 요약이 이어집니다. 상담에서는 분류, QA, 지식 검색이 붙고, 음성 에이전트에서는 다시 TTS가 연결됩니다.

그래서 HAIV를 단순히 “음성을 글자로 바꾸는 엔진”으로만 보면 역할을 절반만 보게 됩니다. 실제 기업 업무 안에서는 음성을 데이터로 바꾸고, 그 데이터를 다음 AI 시스템으로 넘기는 입력 계층에 가깝습니다.

Speech 회의 · 상담 · 음성 HAIV STT Speech → Text Understanding 화자 분리 · 요약 · 분석 RAG · 업무 판단 Action 업무 시스템 · Agent TTS Voice
기업 업무에서 STT는 독립된 결과물이 아니라, 이해·판단·실행으로 이어지는 전체 AI 흐름의 시작점이 됩니다.
결국 HAIV를 볼 때 가장 중요한 질문은 “정확도가 몇 퍼센트인가”가 아닙니다.

우리 업무에서 어떤 단어가 중요하고, 어떤 오류가 비용을 만들며, 어느 속도로 처리해야 하고, 어디에서 운영해야 하는가.

기업용 음성 AI의 품질은 모델 하나가 아니라 이런 조건들이 맞물릴 때 만들어집니다. HAIV는 그 조건을 실제 업무 안에서 풀어가는 엔진입니다.