Whisper API로 음성 인식 서비스 직접 구축하기
OpenAI Whisper API를 사용하면 회의록·인터뷰·강의를 자동으로 텍스트로 변환하고, 로컬 환경에서도 무료로 음성 인식 시스템을 구축할 수 있어요.
따라 하기
1단계
OpenAI 계정 생성 및 API 키 발급
- 1platform.openai.com에 접속해 Sign up(가입하기) 버튼을 클릭합니다.
- 이메일 또는 Google 계정으로 가입 후 이메일 인증을 완료합니다.
- 2로그인 후 우측 상단 계정 아이콘›API keys›+ Create new secret key를 클릭해 API 키를 발급받습니다.
- 3발급된 키는 한 번만 표시되므로 안전한 곳에 저장해 두세요.
openai.com/research/whisper
팁 Whisper API는 음성 1분당 약 $0.006이 청구됩니다. 처음 가입 시 무료 크레딧이 제공됩니다. 크레딧 잔액은 platform.openai.com/usage에서 확인할 수 있습니다.
처음이라 잘 모르겠다면
OpenAI API 키 발급 후 Python에서 openai.audio.transcriptions.create() 함수로 음성 파일을 텍스트로 변환할 수 있어요.
막히면 볼 것
자주 하는 실수 3가지
- language 파라미터 미지정 → 언어 자동 감지로 한국어 정확도 저하 — 반드시 language='ko' 명시
- 25MB 초과 파일 한 번에 전송 → API 오류 — pydub으로 10분씩 분할 후 각각 변환·합치기
- 로컬 Whisper에서 fp16=True (CPU 환경) → 오류 발생 — CPU에서는 fp16=False 설정 필수
AI 없이 할 때와 뭐가 다른가요?
음성 파일 → Whisper API → 정확한 텍스트 변환 + 화자 구분
1시간짜리 회의 녹음을 텍스트로 바꾸는 데 비싼 서비스 쓰거나 직접 다 타이핑해야 해...
나
음성 인식 서비스는 분당 비용이 높거나 정확도가 낮습니다.