BLOG · 블로그

팀벨 블로그

업무를 끝내는 AI,
팀벨이 만드는 제품과 기술, 도입 사례를 가장 먼저 전합니다.

블로그› 테크› 기업 환경에서 음성인식 엔진을 설계할 때 보는 것들

기업 환경에서 음성인식 엔진을 설계할 때 보는 것들

HAIV 음성인식 엔진을 Tech Blog 관점에서 살펴봅니다. 사용자 사전, 디코딩, 실시간 처리, 배포 아키텍처, 운영 관점의 기술적 고려사항을 정리합니다.

HAIV STT · TTS · DOMAIN ADAPTATION

기업용 음성인식에서 가장 먼저 생기는 오해는 “정확도가 높은 모델 하나면 충분하다”는 생각입니다. 실제 운영에서는 같은 모델도 어떤 도메인에 붙이는지, 어떤 방식으로 후보를 고르는지, 얼마나 빠르게 결과를 내는지, 그리고 어디에 배포하는지에 따라 체감 품질이 크게 달라집니다.

01 · Problem Definition

평균 정확도보다 중요한 것은 오류가 나는 위치입니다

일반적인 문장은 대부분의 최신 음성인식 엔진이 꽤 잘 처리합니다. 차이는 오히려 인명, 지명, 상품명, 조직명, 약어, 전문용어처럼 빈도는 낮지만 업무상 중요도가 높은 구간에서 드러납니다.

회의록에서 이름 하나가 틀리면 화자 추적이 어려워지고, 상담 기록에서 상품명이 틀리면 후속 분석이나 QA 결과까지 영향을 받습니다. 따라서 기업용 ASR에서는 전체 WER 하나만 보는 것보다 도메인 용어 오류율과 후처리 비용을 함께 보는 편이 실용적입니다.

GENERAL WER

전체 문장 정확도

전반적인 전사 품질을 보는 기본 지표입니다.

TERM ERROR

전문용어 오류

인명·상품명·전문용어가 실제로 얼마나 틀리는지 봅니다.

EDIT COST

후처리 비용

사람이 수정할 때 어느 오류가 가장 많은 시간을 쓰게 하는지 봅니다.

Tech Blog 관점에서는 “정확도 몇 %”보다 어떤 오류가 운영 비용으로 이어지는지를 보는 편이 더 중요합니다.
02 · Decoding

사용자 사전은 모델을 다시 학습시키는 기능이 아닙니다

HAIV에서 인명, 지명, 전문용어를 등록하는 사용자 사전은 모델 파라미터를 매번 다시 학습시키는 방식과는 다릅니다. 실제 인식 과정에서는 음성 신호로부터 여러 후보가 만들어지고, 디코더가 그중 가장 가능성이 높은 결과를 선택합니다. 사용자 사전은 이 후보 선택 과정에 업무 맥락을 추가하는 방식으로 이해하면 쉽습니다.

Audio Input meeting.wav Acoustic Model 후보 생성 Decoder candidate A candidate B domain term ↑ User Dictionary 인명 · 지명 · 전문용어 Text context-aware 모델 파라미터는 유지 후보 선택 단계에서 맥락 반영
사용자 사전은 업무에 필요한 단어가 디코딩 단계에서 살아남도록 후보 점수에 맥락을 주는 방식으로 이해할 수 있습니다.
사용자 사전에서 중요한 것은 “단어를 얼마나 많이 넣는가”가 아니라, 어떤 도메인에서 어떤 표기로 어떤 단어를 밀 것인가입니다.
03 · Streaming

실시간 STT는 정확도와 지연시간의 문제입니다

배치 음성인식은 전체 파일을 확보한 뒤 처리할 수 있지만, 실시간 음성인식은 입력이 계속 들어오는 상태에서 결과를 내야 합니다. 따라서 모델의 정확도만 높여서는 충분하지 않습니다.

01 · CHUNKING

오디오 분할

연속 입력을 짧은 단위로 나눠 처리합니다.

02 · INFERENCE

실시간 추론

입력보다 빠른 속도로 모델 추론이 이어져야 합니다.

03 · DECODING

부분 결과 확정

중간 결과와 최종 결과의 안정성을 함께 관리합니다.

04 · DELIVERY

서비스 전달

자막·회의록·상담 UI에 지연 없이 반영되어야 합니다.

특히 긴 발화에서는 앞부분의 문맥을 어디까지 유지할지, 중간 결과를 언제 확정할지, 네트워크 지연이나 동시 접속이 늘어날 때 처리량을 어떻게 유지할지가 중요합니다.

실시간 STT의 품질은 모델 정확도 하나가 아니라
latency, stability, throughput을 같이 봐야 합니다.
04 · Deployment

엔진 구조만큼 중요한 것이 배포 구조입니다

금융, 공공, 기업 내부 회의처럼 음성을 외부로 보낼 수 없는 환경에서는 클라우드 API만으로는 도입이 어려울 수 있습니다. 이 경우 음성 AI 엔진은 사내 서버나 폐쇄망에 들어가 기존 업무 시스템과 직접 연결되어야 합니다.

구분 Cloud On-Premise Hybrid
구축 속도 빠름 인프라 준비 필요 구성에 따라 다름
데이터 통제 외부 전송 전제 내부 통제에 유리 업무별 분리 가능
운영 유연성 확장에 유리 내부 정책 반영에 유리 양쪽 장점 조합
적합 환경 일반 서비스 금융·공공·민감 데이터 복합 업무 환경
05 · System Integration

실제 제품에서는 STT가 파이프라인의 시작점입니다

음성인식 엔진이 텍스트를 내놓는 순간 업무가 끝나는 경우는 드뭅니다. 회의록에서는 화자 분리와 요약이 이어지고, 상담에서는 분석과 분류, QA가 붙습니다. 음성 에이전트에서는 다시 TTS가 붙어 응답을 생성합니다.

Speech Audio Stream STT HAIV Understanding 화자분리 · 요약 분석 · 분류 · RAG Action Agent · Workflow TTS HAIV
제품 관점에서는 STT가 독립 기능이 아니라, 전체 AI 업무 파이프라인의 입력 계층으로 동작합니다.
06 · Operational Checklist

운영에 들어가기 전에 확인할 것

1. 도메인별 고유명사와 전문용어 목록이 정리되어 있는가
2. 사용자 사전 표기가 한글/영문/띄어쓰기 기준으로 통일되어 있는가
3. 실시간 사용 시 허용 가능한 latency가 정의되어 있는가
4. 긴 음성과 동시 세션에 대한 처리량 테스트가 되어 있는가
5. 배포 환경이 Cloud / On-Premise / Hybrid 중 무엇인지 정해져 있는가
6. STT 이후 화자분리·요약·분석·TTS 연결 지점이 정의되어 있는가

결국 음성인식 엔진을 운영한다는 것은 모델 하나를 서버에 올리는 일이 아니라, 도메인 언어, 실시간성, 인프라, 후속 파이프라인을 함께 설계하는 일에 가깝습니다.

HAIV를 기술적으로 볼 때 핵심은 “음성을 얼마나 잘 받아 적는가”에서 끝나지 않습니다.

어떤 업무 언어를 처리해야 하는지, 어느 정도의 지연을 허용할지, 어디에 배포할지, 그리고 인식 결과가 다음 시스템으로 어떻게 이어질지까지 포함해야 실제 기업용 음성 AI 엔진이 됩니다.

팀벨의 다음 소식이 궁금하다면

제품 도입·협업·취재 문의를 남겨주세요.