한 줄 요약
ASR 모델에서 전사 스타일을 명시적 변수로 제어하여 해독 불안정성과 평가 혼란을 해결하고, 정확한 단어 수준 타이밍을 달성한다.
핵심 기여도
- Coverage-aware decoder task tokens을 사용하여 영어 학습 모델로 독일어 불유창성 F1 점수를 10%에서 79%로 제로샷 증가.
- Supervised cross-attention fine-tuning으로 불유창 발화에서 단어 수준 타이밍 오차를 102ms로 줄여, forced-alignment 기반 모델(142–200ms)을 초과.
- Verbatimize라는 새로운 작업을 제안하여, 고정밀 전사 코퍼스를 확장하고, 희귀 단어 회수율을 6.8%에서 96.1%로 향상.
- 언어 무관 평가 프레임워크를 도입하여, 전사 스타일에 따른 WER 분해를 가능하게 함.
핵심 아이디어
기존 ASR 모델은 전사 스타일(verbatim vs. intended)을 명시적으로 제어하지 못하는 **잠재 변수(latent variable)**로 취급하여, 해독 불안정성, 평가 혼란, 단어 수준 타이밍 불확실성을 유발한다. 본 연구는 Whisper와 같은 대규모 모델이 이미 두 스타일을 인코딩하고 있지만, **제어가 필요한 문제**라는 점을 밝히고, 이를 해결하기 위해 세 가지 메커니즘을 제안한다.
첫째, **mode tag**를 사용한 명시적 스타일 제어: decoder prefix 토큰으로 전사 정책을 이진 선택(verbatim vs. intended)으로 명시.
둘째, **supervised cross-attention**을 통한 단어 수준 타이밍 정확도 향상: word-boundary 타겟으로 cross-attention 헤드를 직접 감독.
셋째, **verbatimize**라는 새로운 작업: 입력 오디오와 intended 전사로부터 verbatim 전사를 복원, 희귀 단어 회수율을 6.8%에서 96.1%로 향상.
이러한 접근은 기존 ASR 모델의 잠재 능력을 **활성화**하는 데 초점을 맞추며, 학습된 파라미터를 변경하지 않아도 성능 향상이 가능하다는 점에서 혁신적이다.
기술적 접근법
- **Mode tags**: [verbatim_1,2,3], [intended_1,2,3,4,5] 등 10개 토큰을 사용하여 전사 정책을 명시.
- **Supervised cross-attention**: 특정 cross-attention 헤드를 word-boundary 타겟으로 감독.
- **Verbatimize**: <sot>, <eot> 등 2개의 delimiter 토큰과 함께, 오디오와 intended 전사로부터 verbatim 전사 복원.
- **Vocabulary 확장**: [uh], [um], [laughter], [cough] 등 14개의 새로운 토큰 추가.
- **Fine-tuning**: Whisper-medium 모델을 기반으로, encoder/decoder 파라미터는 고정, 새로운 토큰 임베딩만 학습.
주요 결과
- **Disfluency detection**: 영어 DisfluencySpeech에서 79% F1 (기존 10%에서 제로샷 증가), 독일어 94% F1.
- **Word-level timing**: FluencyBank에서 102ms mean absolute boundary error (forced-alignment 기반 142–200ms 대비 개선).
- **Verbatimize**: ICSI 희귀 단어 평가에서 96.1% recall (기존 6.8% 대비 +89.3%).
- **WER 분해**: AMI 데이터셋에서 60%의 WER가 스타일 불일치로 인한 것으로 밝혀짐.
의의 및 한계
본 연구는 ASR 모델에서 전사 스타일을 명시적으로 제어함으로써, 해독 불안정성과 평가 혼란을 줄이고, 단어 수준 타이밍 정확도를 향상시킬 수 있음을 입증한다. 특히, **mode tag**를 사용한 제로샷 학습과 **verbatimize**를 통한 대규모 전사 코퍼스 생성은 ASR 및 음성 분석 분야에 실질적 기여를 한다.
그러나 한계도 존재한다. 독일어 외 다른 언어로의 전이 성능은 평가되지 않았으며, 독일어 평가 데이터는 연구자들이 직접 녹음한 것이므로 자연스러운 불유창성 표현이 부족할 수 있다. 또한, 타이밍 감독은 MFA 기반 정렬에 의존하며, 수작업 경계 라벨은 사용되지 않았다.
실용적 활용
본 연구는 의료, 교육, 언어학 분야에서 불유창성 분석이 필요한 음성 데이터 처리에 적용 가능하다. 특히, **verbatimize**는 저비용으로 대규모 전사 코퍼스를 확장할 수 있는 도구로 활용될 수 있으며, **mode tag** 기반 제어는 ASR 모델의 출력 정책을 유연하게 조절하는 데 유용하다.