Whisper

이게 가능해져요

음성 파일 → Whisper API → 정확한 텍스트 변환 + 화자 구분

Claude
1시간짜리 회의 녹음을 텍스트로 바꾸는 데 비싼 서비스 쓰거나 직접 다 타이핑해야 해...
음성 인식 서비스는 분당 비용이 높거나 정확도가 낮습니다.MCP 미연결

Whisper API로 음성 인식 서비스 직접 구축하기

High class25활용 사례

OpenAI Whisper API를 사용하면 회의록·인터뷰·강의를 자동으로 텍스트로 변환하고, 로컬 환경에서도 무료로 음성 인식 시스템을 구축할 수 있어요.

Whisper 열기

github.com/openai/whisper

실수 방지 체크리스트
  • 1language 파라미터 미지정 → 언어 자동 감지로 한국어 정확도 저하 — 반드시 language='ko' 명시
  • 225MB 초과 파일 한 번에 전송 → API 오류 — pydub으로 10분씩 분할 후 각각 변환·합치기
  • 3로컬 Whisper에서 fp16=True (CPU 환경) → 오류 발생 — CPU에서는 fp16=False 설정 필수
STEP 1 / 5
1

STEP 1. OpenAI 계정 생성 및 API 키 발급

openai.com/research/whisper
Whisperby OpenAI
음성을 텍스트로 변환
98개 언어 지원, 높은 정확도의 음성 인식 AI
오디오 파일을 드래그하거나 클릭MP3, MP4, WAV, M4A 지원 (최대 25MB)
한국어
English
日本語
中文

platform.openai.com에 접속해 'Sign Up' 버튼을 클릭합니다. 이메일 또는 Google 계정으로 가입 후 이메일 인증을 완료합니다. 로그인 후 우측 상단 계정 아이콘 → 'API keys' → '+ Create new secret key'를 클릭해 API 키를 발급받습니다. 발급된 키는 한 번만 표시되므로 안전한 곳에 저장해 두세요.

Whisper API는 음성 1분당 약 $0.006이 청구됩니다. 처음 가입 시 무료 크레딧이 제공됩니다. 크레딧 잔액은 platform.openai.com/usage에서 확인할 수 있습니다.

이 단계를 완료했나요?