화자 분리(Diarization) 구현하기

고급약 40분3단계

pyannote.audio와 Whisper를 결합해 누가 언제 말했는지 구분하는 화자 분리 전사를 구현합니다.

같은 일을 더 자세히 다룬 글: OpenAI Whisper로 음성·영상 텍스트 변환하기

따라 하기

1단계 / 3

pyannote 설정

pyannote.audio 패키지를 설치하고 Hugging Face 토큰으로 인증합니다.

speaker-diarization-3.1 파이프라인을 로드합니다.

Whisper 열기

이해를 돕는 예시 그림이에요. 실제 화면과 다를 수 있어요.

openai.com/research/whisper
Whisperby OpenAI
음성을 텍스트로 변환
98개 언어 지원, 높은 정확도의 음성 인식 AI
오디오 파일을 드래그하거나 클릭MP3, MP4, WAV, M4A 지원 (최대 25MB)
한국어
English
日本語
中文

누를 위치 pip install pyannote.audio›HF 토큰 설정›파이프라인 로드

팁 Hugging Face 모델 접근 권한을 설정 페이지에서 승인해야 합니다.