펍스테이션
001공공

AI 속기록(STT) 파이프라인

장시간 다화자 영상 367건 처리, 정확도 96.4%

과제

여러 사람이 번갈아 말하는 장시간 영상을 문서로 옮기는 일은 사람 손으로는 비용이 큽니다.

002APPROACH

접근

음성 인식 → 화자 분리·매핑 → 자동 교정 → 검수 게이트로 이어지는 파이프라인을 만들었습니다. 화자 라벨과 발화 의미는 보존하고 오탈자만 보수적으로 교정합니다.

003RESULT

결과 · 사용 기술

장시간 다화자 영상 367건 처리, 정확도 96.4%

음성 인식화자 분리자동 교정검수 게이트