음성인식·합성 엔진

HAIV STT·TTSGS인증 1등급

한국어에 가장 강한 자체 음성인식·합성 엔진

한국어 98,000시간으로 학습한 자체 음성인식(STT)·합성(TTS) 엔진. 온프레미스로 동작하며 SDK·API·엔진 임베드로 어디에나 통합됩니다.

GS인증 1등급98,000h 학습종단형 STT · DNN TTS온프레미스SDK·API
HAIV STT·TTS 제품 화면
OVERVIEW

20년·98,000시간의 한국어 음성 데이터로 학습한 자체 STT·TTS 엔진입니다. 종단형(E2E) 인식 엔진이 금융·보험·공공의 전문용어·고유명사까지 평균 0.275초로 정확히 받아쓰고(STT), 자체 DNN 파운데이션 모델이 30자 기준 0.3초 이내로 감정·속도·언어를 조절한 사람 같은 음성을 생성합니다(TTS). 온프레미스로 동작해 통화·음성 데이터가 외부로 나가지 않으며, 팀벨 전 제품군의 음성 기반이자 SDK·API·엔진 임베드로 바로 도입할 수 있습니다.

DEMO

HAIV STT·TTS 데모 영상

팀벨 자체 음성 엔진 HAIV의 실시간 음성인식(STT)·음성합성(TTS) 데모 영상.

데모 신청하기
WHO IT'S FOR

이런 분께 추천합니다

한국어 인식률이 아쉬워요

해외 엔진은 전문용어에 약합니다. 98,000시간 한국어 학습으로 정확하게 인식합니다.

음성 데이터를 못 내보내요

규제 산업은 외부 전송이 불가합니다. 온프레미스로 내부에서 동작합니다.

엔진만 도입하고 싶어요

우리 시스템에 STT만 붙이고 싶습니다. SDK·API·엔진 임베드로 제공합니다.

KEY FEATURES

핵심 기능

FEATURE

실시간 음성인식(STT)

종단형(E2E) 엔진이 말이 끝나기 전부터 N음절 단위로 받아쓰고, 발화종료감지(EPD)로 평균 0.275초에 결과를 확정합니다. 통화별 인식 결과·화자분리(송·수신)·인식률을 목록으로 한눈에 확인합니다.

실시간 음성인식(STT)
FEATURE

음성합성(TTS)

자체 DNN 파운데이션 모델이 30자 기준 0.3초 이내(RTF 0.1 미만)로 합성합니다. 목소리·감정·언어·속도·높낮이를 설정해 사람처럼 자연스러운 음성을 생성하고 바로 재생·다운로드합니다.

음성합성(TTS)
FEATURE

사용자 사전 관리

기호·약어·외래어·인명·전문용어를 원하는 독음으로 교정하고, 엑셀 파일로 수백 건을 한 번에 등록(Batch)해 도메인별 인식·발화 정확도를 함께 끌어올립니다.

사용자 사전 관리
FEATURE

평가 관리

CER(음절 단위) 기반으로 인식 정확도를 객관적으로 평가·관리하고, 비전문가도 웹 화면에서 음향·언어 모델을 재학습해 정확도를 지속 개선합니다.

평가 관리
FEATURE

시스템 모니터링

STT 채널·CPU·메모리·네트워크 등 엔진 상태를 실시간 모니터링합니다. Docker 기반 MSA(무중단)로 150채널 이상 대규모 트래픽에서도 안정적으로 운영합니다.

시스템 모니터링
STT · SPEECH-TO-TEXT

음성인식(STT) 특장점

E2E 트랜스포머 기반 종단형 STT 엔진으로 복잡한 발화 환경에서도 높은 인식률과 초저지연 응답을 제공합니다.

01

최신 종단형(End-to-End) 알고리즘

  • 통합 모델 구조 음향·언어·발음 모델을 하나의 구조로 단순화해 복합적인 발화 환경에서도 인식 오차를 최소화합니다.
  • 인식 안정성 검증 연속 발화·전화 음질 환경에서 품질이 검증된 자체 엔진(HAIV)을 적용합니다.
  • 노이즈 캔슬링 VAD(Voice Activity Detection) 기반 기술로 주변 소음을 제어하고 선명한 음성만 추출합니다.
02

실시간 스트리밍 및 초저지연 응답

  • 실시간 텍스트 변환 발화 종료를 기다리지 않고 N음절 단위로 음성을 분할해 즉각적으로 변환합니다.
  • 0.275초 응답 속도 실시간성 측정 결과 평균 0.275초의 빠른 응답으로 대화의 흐름을 유지합니다.
  • 발화종료감지(EPD) 최적화 Gen AI sLLM의 스트리밍 응답 특성을 고려해 발화 종료 시점에 결과를 즉시 확정합니다.
03

지능형 전·후처리 및 가독성 향상

  • ITN(Inverse Text Normalization) 약어·이메일·숫자·날짜 등을 ‘11:45 AM’처럼 가독성 높은 표준 표기로 자동 변환합니다.
  • 도메인 특화 사전 관리 힌트 사전·사용자 사전을 활용해 전문 상품명·업계 용어의 인식률을 고도화합니다.
  • 화자 분리(RX/TX) 고객과 상담원의 음성을 분리해 인식하고, 이를 하나의 대화로 합성합니다.
04

GUI 기반 통합 학습·성능 관리

  • 비전문가용 학습 도구 웹 화면만으로 전문 엔지니어 없이 운영자가 직접 음향·언어 모델을 재학습할 수 있습니다.
  • CER 기반 성능 평가 음절 단위 평가 방식(CER)으로 학습 전후의 인식 정확도를 객관적으로 검증합니다.
  • 전사 전용 툴 제공 학습 데이터 생성을 위해 음성 구간 재생·텍스트 수정을 지원하는 워크벤치를 제공합니다.
05

고가용성 MSA·컨테이너 아키텍처

  • 유연한 확장 구조 Docker 기반 Master/Worker 구조로 채널 확장이 쉬우며 마이크로서비스 아키텍처(MSA)를 적용합니다.
  • 무중단 서비스 운영 시스템 중단 없이 신규 엔진 모델을 교체하고, 장애 시 다른 Worker 서버로 즉시 절체합니다.
  • 유연한 시스템 연동 표준 API·Web Socket 기반 설계로 Voice Gateway·콜봇 등 타 시스템과 신속히 연동합니다.
06

철저한 데이터 보안·개인정보 비식별화

  • 국제 표준 암호화 모든 음성 인식 결과 데이터에 AES256 알고리즘을 적용해 저장·전송 구간 보안을 강화합니다.
  • 실시간 마스킹 발화 중 전화번호·주민번호 등 민감 정보를 자동 탐지해 비식별 처리합니다.
  • 망 분리 및 접근 제어 고객사 내부망 안에서 모든 데이터를 처리하며 외부망으로의 전송을 원천 차단합니다.
TTS · TEXT-TO-SPEECH

음성합성(TTS) 특장점

DNN 파운데이션 모델로 최소한의 데이터로 감정을 복제하고, 실시간 TTS의 한계를 넘어 사람처럼 자연스러운 발화를 제공합니다.

01

DNN 기반 파운데이션 모델 및 고품질 합성

  • Transformer 아키텍처 적용 최신 딥러닝 기반 파운데이션 모델로 기계음이 아닌 실제 사람과 유사한 자연스러운 운율을 구현합니다.
  • 선명한 음질 보장 고해상도 샘플링 기술로 노이즈 없는 깨끗한 음성 출력과 정교한 발음 서비스를 제공합니다.
  • 고품질 상담 경험 독자적 엔진으로 정확한 텍스트 분석·발화 처리를 수행해 고객에게 이질감 없는 음성을 전달합니다.
02

초저지연 실시간 스트리밍 기술

  • 0.3초 이내 응답 속도 첫 음성 출력까지의 지연을 0.3초 이내(RTF 0.1 미만)로 단축해 끊김 없는 실시간 대화 환경을 지원합니다.
  • 문장 분절 합성 전체 문장이 완성되기 전에도 텍스트를 실시간 분할 합성해 LLM의 스트리밍 응답과 완벽하게 조화됩니다.
  • 대규모 트래픽 안정성 150채널 이상의 고부하 상황에서도 처리 속도 저하 없이 일관된 합성 품질과 응답 성능을 유지합니다.
03

보이스 클로닝 및 감정 표현 기술

  • Less-DATA 학습 약 2~20시간의 소량 데이터만으로 특정 성우의 음색을 정교하게 복제해 고유의 브랜드 목소리를 생성합니다.
  • 멀티 스타일 제어 공감·사과·기쁨 등 상담 맥락에 따른 다양한 감정 톤을 적용해 상황별 최적화된 고객 친화적 응대가 가능합니다.
  • 정밀 파라미터 조절 합성 단계에서 속도(Speed)·높낮이(Pitch)·볼륨 등을 실시간으로 미세 조정해 발화 품질을 극대화합니다.
04

대규모 화자 라이브러리 및 전용 페르소나

  • 방대한 화자 라인업 성별·연령대별로 구분된 수천 명의 고유 화자 라이브러리로 서비스 특성에 맞는 목소리 선택권을 제공합니다.
  • 브랜드 페르소나 구축 기업 브랜드 이미지에 최적화된 전용 성우 보이스를 개발해 일관된 브랜드 아이덴티티를 전달합니다.
  • 다국어 확장성 한국어뿐 아니라 글로벌 대응을 위한 다국어 합성 엔진을 지원해 다양한 서비스 환경에 유연하게 대응합니다.
05

지능형 텍스트 분석 및 발음 최적화

  • 도메인 전처리 숫자·영어·특수문자가 혼용된 복잡한 문장도 업계 특유의 문맥을 분석해 정확하게 읽어주는 기술을 탑재했습니다.
  • 자연스러운 문맥 처리 의미 단위의 띄어 읽기와 문장 구조에 따른 멈춤 처리를 자동으로 수행해 정보 전달력과 가독성을 높입니다.
  • 사용자 정의 발음 사전 약어·전문 용어 등에 대해 운영자가 직접 발음 방식·억양을 설정할 수 있는 관리 기능을 제공합니다.
06

표준 인터페이스 및 통합 관리 환경

  • 표준 API 연동 gRPC·REST API 등 표준 프로토콜을 지원해 콜봇·sLLM·미디어 서버 등 외부 시스템과 신속하게 연계합니다.
  • 웹 기반 통합 GUI 직관적인 관리자 화면으로 합성 이력 조회·엔진 상태 모니터링·성능 통계를 실시간으로 관리합니다.
  • 멀티 포맷 지원 WAV·MP3·PCM 등 다양한 오디오 포맷과 샘플 레이트(8Khz/16Khz)를 지원해 시스템 환경별 최적 출력을 보장합니다.
PRODUCT TOUR

성능과 구성

학습할수록 높아지는 정확도
학습할수록 높아지는 정확도대부·보험·상담 도메인에서 학습 후 93~95%까지 인식률 향상.
온프레미스 시스템 구성
온프레미스 시스템 구성고객사 내부망에 STT·연동장비를 구축하는 레퍼런스 아키텍처.
STT 배치 처리
STT 배치 처리대량 음성 파일을 배치로 일괄 인식·처리.
상담 내용 수정
상담 내용 수정STT 결과를 현장에서 바로 검수·수정.
SPECIFICATION

핵심 사양

학습 데이터한국어 98,000시간 — 잡음·사투리·전문용어 포함
음성인식(STT)종단형(E2E) 실시간 스트리밍 · 평균 0.275초 응답 · 화자분리(송·수신)
음성합성(TTS)DNN 파운데이션 모델 · 30자 0.3초 이내(RTF 0.1 미만) · 감정·속도·높낮이 조절
보이스 클로닝2초~20초 샘플로 별도 학습 없이 목소리 복제 · 상황별 감정 스타일
전·후처리ITN 가독성 변환(날짜·숫자·약어) · 사용자 발음 사전(엑셀 일괄 등록)
정확도도메인 학습 후 93~95% 인식률 · CER 기반 성능 관리
출력 · 연동8/16kHz · wav·mp3·pcm·u-law · gRPC/REST·WebSocket
아키텍처 · 보안MSA 무중단 · 150채널 이상 · AES256 암호화 · 실시간 마스킹 · 망분리
배포온프레미스 / 프라이빗 — 음성 데이터 외부 미전송
도입 형태SDK · API · 엔진 임베드
품질 인증GS인증 1등급 — TTA 소프트웨어 품질인증 최고 등급
적용팀블로·바로노트 등 전 제품군 음성 기반
CERTIFIED · 품질 인증
GS인증 1등급 GOOD Software

HAIV GS인증 1등급

팀벨의 자체 AI 음성인식 엔진 HAIV(하이브)도 GS인증 1등급을 획득했습니다. 팀벨은 HAIV·바로노트·팀블로로 이어지는 GS인증 1등급 솔루션을 보유하며, 국가 공인 기준에서 품질·안정성·보안성을 모두 검증받았습니다.

GS인증 1등급 (TTA)한국어 98,000h 학습온프레미스
HAIV 하이브 음성인식 엔진
CASE STUDIES

도입 사례

HAIV STT·TTS와 같은 기술이 현장에서 검증됐습니다

전체 고객사례 보기
FAQ

자주 묻는 질문

STT 실시간 스트리밍 지연은 얼마나 되나요?
종단형(E2E) 엔진이 발화 도중 N음절 단위로 받아쓰고 발화종료감지(EPD)로 평균 0.275초에 결과를 확정합니다. 음성합성(TTS)은 30자 기준 0.3초 이내(RTF 0.1 미만)입니다.
보이스 클로닝은 몇 초 샘플로 되나요?
최소 2초~20초 분량의 짧은 음성 샘플만으로 별도 학습 없이 목소리를 복제하고, 공감·사과·기쁨 등 감정 스타일까지 적용할 수 있습니다.
온프레미스로 STT·TTS 엔진만 도입할 수 있나요?
네. SDK·API·엔진 임베드로 기존 시스템에 통합되며, 온프레미스로 동작해 음성 데이터가 외부로 나가지 않습니다(AES256 암호화·실시간 마스킹·망분리).
어떤 산업에 강한가요?
금융·보험·공공 등 전문용어·고유명사가 많은 도메인에 강합니다. 산업별 전문용어·고유명사를 사전·맥락으로 정확히 인식합니다.
온프레미스만 되나요?
온프레미스·프라이빗 클라우드를 지원해 음성 데이터 외부 전송 없이 운영합니다. 규제 산업의 컴플라이언스 요건을 충족할 수 있습니다.
어떻게 도입하나요?
SDK·API·엔진 임베드 형태로 기존 시스템에 통합할 수 있습니다.
한국어 인식 정확도는 어느 정도인가요?
한국어 98,000시간 학습을 기반으로, 고객사 도메인 데이터로 지속 학습하면 도메인별 인식 정확도가 93~95% 수준까지 향상됩니다. 모든 학습은 온프레미스에서 이뤄집니다.
음성합성(TTS)도 되나요?
네. 감정·속도·높낮이·언어를 조절한 자연스러운 음성을 실시간으로 생성합니다. STT와 TTS를 함께 도입할 수 있습니다.
인증을 받았나요?
HAIV는 GS인증 1등급(TTA 소프트웨어 품질인증 최고 등급)을 획득했습니다.
실시간 받아쓰기와 화자분리가 되나요?
네. 말이 끝나기 전부터 받아쓰는 저지연 스트리밍 인식을 제공하며, 화자분리와 연동해 활용할 수 있습니다.
RELATED

함께 보면 좋은 제품

HAIV STT·TTS 도입 문의

도입 상담부터 맞춤 구축까지, 팀벨이 함께합니다.