Whisper API로 음성 인식 서비스 직접 구축하기

고급약 25분5단계

OpenAI Whisper API를 사용하면 회의록·인터뷰·강의를 자동으로 텍스트로 변환하고, 로컬 환경에서도 무료로 음성 인식 시스템을 구축할 수 있어요.

따라 하기

1단계 / 5

OpenAI 계정 생성 및 API 키 발급

  1. 1platform.openai.com에 접속해 Sign up(가입하기) 버튼을 클릭합니다.
  2. 이메일 또는 Google 계정으로 가입 후 이메일 인증을 완료합니다.
  3. 2로그인 후 우측 상단 계정 아이콘›API keys›+ Create new secret key를 클릭해 API 키를 발급받습니다.
  4. 3발급된 키는 한 번만 표시되므로 안전한 곳에 저장해 두세요.
Whisper 열기

이해를 돕는 예시 그림이에요. 실제 화면과 다를 수 있어요.

openai.com/research/whisper
Whisperby OpenAI
음성을 텍스트로 변환
98개 언어 지원, 높은 정확도의 음성 인식 AI
오디오 파일을 드래그하거나 클릭MP3, MP4, WAV, M4A 지원 (최대 25MB)
한국어
English
日本語
中文

팁 Whisper API는 음성 1분당 약 $0.006이 청구됩니다. 처음 가입 시 무료 크레딧이 제공됩니다. 크레딧 잔액은 platform.openai.com/usage에서 확인할 수 있습니다.

처음이라 잘 모르겠다면

OpenAI API 키 발급 후 Python에서 openai.audio.transcriptions.create() 함수로 음성 파일을 텍스트로 변환할 수 있어요.

막히면 볼 것

자주 하는 실수 3가지
  1. 1language 파라미터 미지정 → 언어 자동 감지로 한국어 정확도 저하 — 반드시 language='ko' 명시
  2. 225MB 초과 파일 한 번에 전송 → API 오류 — pydub으로 10분씩 분할 후 각각 변환·합치기
  3. 3로컬 Whisper에서 fp16=True (CPU 환경) → 오류 발생 — CPU에서는 fp16=False 설정 필수
AI 없이 할 때와 뭐가 다른가요?

음성 파일 → Whisper API → 정확한 텍스트 변환 + 화자 구분

1시간짜리 회의 녹음을 텍스트로 바꾸는 데 비싼 서비스 쓰거나 직접 다 타이핑해야 해...
나
음성 인식 서비스는 분당 비용이 높거나 정확도가 낮습니다.지금까지