OpenAI Whisper로 음성·영상 텍스트 변환하기

기초약 15분4단계

세계 최고 수준의 음성 인식 AI예요. 한국어·영어 포함 99개 언어를 지원하고, 무료로 로컬에서 실행하거나 API로 호출할 수 있어요.

따라 하기

1단계 / 4

Whisper 설치 (Python)

  1. 1터미널에서 pip install openai-whisper를 실행합니다.
  2. FFmpeg도 필요합니다(Mac: brew install ffmpeg, Windows: ffmpeg.org에서 다운로드). GPU가 있으면 pip install torch로 가속화 가능합니다.
  3. 2설치 후 whisper --help로 정상 설치를 확인합니다.
Whisper 열기

이해를 돕는 예시 그림이에요. 실제 화면과 다를 수 있어요.

openai.com
Whisper 실제 화면
실제 화면

팁 Python 환경이 없다면 Google Colab에서 무료로 실행 가능합니다. !pip install openai-whisper 후 바로 사용할 수 있습니다.

처음이라 잘 모르겠다면

Python이 설치된 환경에서 pip install openai-whisper를 실행하고 ffmpeg도 설치하세요.

막히면 볼 것

자주 하는 실수 3가지
  1. 1언어 미지정 → 자동 감지 오류 (한국어를 일본어로 인식 등) — 반드시 --language ko 명시
  2. 2tiny/base 모델 사용 → 전문 용어·고유명사 오인식 — 중요한 전사는 medium 이상 모델 사용
  3. 3배경 소음이 심한 파일 → 정확도 급락 — 사전에 Adobe Podcast로 노이즈 제거 후 전사
막혔을 때 볼 짧은 글 6개
AI 없이 할 때와 뭐가 다른가요?

음성 파일 → Whisper → 정확한 전사 텍스트 즉시

인터뷰 녹음 1시간 받아 적는 데 3시간 걸려...
나
수동 전사 작업은 녹음 시간의 3~5배가 걸립니다.지금까지