2026년 8월 3일 업데이트

음성 텍스트 변환 — AI로 녹음/음성 파일을 무료로 텍스트화 (한국어 지원)

VexaScribe는 음성 파일을 텍스트로 변환합니다. 음성 1시간당 5-15분 소요, 한국어 94-96% 정확도 (Whisper Large-v3 Tier 1, FLEURS CER 5.3%). MP3/M4A/WAV/OGG/FLAC 지원, 파일당 최대 5GB, 10시간, 최대 50개 파일 병렬 처리. TXT, DOCX, SRT, VTT, JSON 내보내기. 30분 무료, 카드 불필요. 월 2달러부터. AWS eu-west-2 (런던) 호스팅.

30분 무료한국어 94-96%GDPR/EU 호스팅최대 5GB / 10시간

3단계로 음성을 텍스트로 변환하는 방법

업로드부터 준비된 트랜스크립트까지, 커피 한 잔의 시간에.

  1. 1

    음성 파일 업로드

    MP3, M4A, WAV, OPUS, OGG, FLAC 파일을 업로드 영역에 드래그. 파일당 최대 5GB, 10시간. 첫 30분은 카드 없이 무료.

  2. 2

    언어 선택 (한국어 자동 감지)

    한국어는 자동 감지됩니다. 또는 99개 언어 중 "한국어" 수동 선택. 여러 화자가 있는 경우 화자 분리 활성화 — Speaker 1, Speaker 2 자동 라벨.

  3. 3

    TXT/DOCX/SRT/VTT/JSON 다운로드

    음성 1시간당 5-15분 후 결과 준비. TXT (일반 텍스트), DOCX (타임스탬프+화자), SRT/VTT (자막), JSON (구조화). 한 번의 처리로 5가지 형식 모두.

무료 음성 텍스트 변환 사이트 — 정직한 비교

모든 도구가 "무료"라고 광고합니다. 각 서비스의 실제 무료 티어를 마케팅 없이 정직하게 비교합니다.

도구무료 티어카드정확도내보내기참고
VexaScribe30분 무료 (1회)불필요94-96% (Tier 1)TXT / DOCX / SRT / VTT / JSONEU 호스팅, 워터마크 없음
Naver Clova Note월 300분불필요한국어 특화 최상TXT / SRT국내 사용 최적, 실시간 강점
Notta월 120분불필요98.86% 클레임 (검증 안됨)TXT / DOCX / SRT미국 호스팅
Evernote유료 플랜 필요필요표시 없음TXT미국 호스팅
Clideo짧은 파일 무료불필요표시 없음TXT여러 오디오 도구 제공
로컬 Whisper (오픈소스)무제한불필요94-96% (Tier 1)자유 (스크립트 의존)GPU + Python 필요

정직한 권고: 순수 국내 한국어 사용 (한국어 실시간 회의 등)에는 Naver Clova Note가 최적입니다. 다국어 팀, 대량 파일 배치, EU 데이터 규정 준수가 필요한 경우 VexaScribe가 최적입니다.

AI 음성 인식 텍스트 변환 — Whisper Large-v3 한국어 정확도

한국어는 Whisper Large-v3의 Tier 1 언어로, OpenAI FLEURS 벤치마크에서 문자 오류율 (CER) 5.3% — 영어 수준에 근접합니다. 실전에서는 오디오 품질에 따라 결과가 달라집니다.

소스정확도참고
스튜디오 녹음, 팟캐스트 (콘덴서 마이크)94-96 %최상의 시나리오 — 검수 최소
Zoom / Teams / Meet 회의 녹음91-95 %압축 아티팩트로 몇 점 감소
스마트폰 근접 녹음 (조용한 방)92-95 %iPhone/Android 마이크 가까이
회의실 다중 화자 녹음85-91 %거리와 겹침으로 정확도 감소
배경 소음 환경 (카페, 거리)78-88 %환경 소음이 신호를 방해
오래된 카세트 디지털화70-82 %테이프 포화와 배경 잡음

지역 방언: 경상도, 전라도, 제주도, 강원도

Whisper Large-v3는 표준 한국어 (서울 방언)를 주로 학습했습니다. 강한 지역 방언에서는 일반적으로 Tier 1 수준보다 3-5% 정확도 감소가 있어 89-92% 대신 94-96%. 강한 방언 자료의 경우 더 여유있는 수동 검수 시간을 계획하세요.

출처: OpenAI Whisper 논문 (arXiv:2212.04356), 부록 D, 표 13 FLEURS. 자세한 내용은 how accurate is Whisper (영문 페이지).

긴 음성/녹음 파일 텍스트화

긴 강의, 하루 회의, 완전한 팟캐스트 아카이브도 처리 가능. 파일당 최대 5GB, 10시간, 최대 50개 파일 병렬 배치.

.mp3

가장 흔한 오디오 형식

.m4a

iPhone / iPad 음성 메모

.wav

무압축 — 스튜디오 품질

.opus

WhatsApp, Discord, 경량 스트리밍

.ogg

Firefox, 오픈소스

.flac

무손실, 큰 파일

.aac

YouTube, iTunes, 스트리밍

최대 파일 크기

5 GB

파일당

최대 지속 시간

10 시간

파일당

병렬 배치

50 파일

동시 처리

음성 텍스트 변환 앱 vs 웹사이트 vs 프로그램

웹사이트 (권장 — 설치 불필요)

VexaScribe와 같은 웹 도구는 설치가 필요 없고 파일을 브라우저에서 바로 업로드. 어느 기기에서든 접근 가능, 자동 업데이트, 클라우드에서 처리하므로 로컬 CPU/GPU 부담 없음.

앱 (모바일 편의성)

iOS/Android 전용 앱은 모바일에서 녹음-변환 통합 워크플로우 제공. 스마트폰에서 즉시 녹음하고 바로 텍스트화하고 싶은 경우 유용. 데스크톱 워크플로우에는 웹사이트가 더 유연.

프로그램 (오프라인, 개인정보 최우선)

로컬 Whisper 등 오픈소스 프로그램은 완전히 오프라인 처리 — 데이터가 기기를 떠나지 않음. 최상의 개인정보 보호를 요구하는 경우 (의료 기록, 법률 상담) 최적. 단점: GPU와 Python 지식 필요, 유지보수 자체 담당.

받아쓰기, 대본 만들기, 문서화 — 실제 사용 사례

한국 사용자가 VexaScribe로 음성을 텍스트화하는 6가지 컨텍스트.

언론 취재 및 인터뷰

인터뷰를 스마트폰으로 녹음, MP3 업로드, 타임스탬프와 함께 인용문 추출. EU 호스팅으로 취재원 보호 (개인정보보호법 준수).

팟캐스트 및 콘텐츠 제작

에피소드를 SEO 쇼노트, 블로그 초안, 소셜 클립으로 변환. 화자 분리로 진행자와 게스트 자동 구분.

대학 및 학습

MP3로 강의 녹음, 텍스트 변환하여 시험 준비용으로 검색 가능하게 만듦. 교수의 강의 노트 준비에도 유용.

회의 및 회의록

Zoom, Teams, Google Meet 녹음을 구조화된 회의록으로 변환. 최대 10명 화자 자동 분리. 자세히는 /ko/hoeuirok-ai 참조.

법률사무소 및 컴플라이언스

고객 상담, 진술서, 청문회 녹음을 DPA 제공 및 EU 데이터 호스팅과 함께 처리. 국내 법률 문서 인증에는 사람 번역가 필요.

질적 연구

심층 인터뷰와 포커스 그룹을 NVivo, ATLAS.ti 또는 MAXQDA용으로 준비. 단어 수준 타임스탬프가 있는 DOCX 또는 JSON 내보내기.

개인정보 및 데이터 보안

파일은 AWS eu-west-2 (런던, EU 관할권)에서 처리되며, 전송 중 TLS 1.2+ 암호화, 저장 시 AES-256 암호화 적용. 귀하의 오디오 데이터로 AI 모델을 학습시키지 않습니다. 언제든지 파일과 계정을 삭제할 수 있습니다.

전문적 용도 (법률사무소, 언론사 취재원 보호, 의료, HR, 공공기관)의 경우 요청 시 DPA (Data Processing Agreement)를 제공하며, GDPR 및 한국 개인정보보호법 요구사항을 모두 충족합니다. Otter, Rev, Descript, Sonix 등 대안은 미국에 호스팅되어 국제 데이터 이전 시 표준계약조항 (SCC) 및 영향평가가 필요합니다.

요금제 (원화 표시)

USD 청구; 원화 환산은 참고용 1$ ≈ 1,350원 (2026년 8월 기준, 일별 환율 변동).

Starter

$2

≈ 2,700원/월

200분

Basic

$5

≈ 6,750원/월

1,000분

Pro

$10

≈ 13,500원/월

2,500분

Studio

$20

≈ 27,000원/월

6,000분

전체 요금제 세부 정보 →

다른 도구를 선택해야 할 때

정직하게: 다른 도구가 더 잘 맞는 사례가 있습니다.

Naver Clova Note — 순수 국내 한국어 사용

실시간 회의 텍스트 변환이나 한국어에만 초점을 맞춘 워크플로우에는 Clova Note가 최적. 네이버 생태계 통합, 한국어 특화 학습, 국내 데이터 센터.

로컬 Whisper — 완전한 오프라인 처리

콘텐츠가 네트워크를 떠날 수 없는 경우 (규제된 의료, 국방, 중요한 지적재산), Whisper Large-v3를 로컬 GPU에 설치. 영원히 무료, 동등한 정확도, 그러나 인프라와 유지보수는 자체 담당.

사람 번역가 — 법률/의료 인증용

법원, 공증인, 규제된 컨텍스트에서 사용할 수 있는 인증된 단어별 트랜스크립트가 필요한 경우, 사람 번역가가 여전히 표준. AI는 94-96%에 도달 — 법률 컨텍스트에서 나머지 4-6%가 중요.

자주 묻는 질문

음성 텍스트 변환은 어떻게 하나요?

3단계입니다. (1) 음성 파일 업로드 — MP3, M4A, WAV, OGG, FLAC 지원, 파일당 최대 5GB / 10시간. (2) 언어 선택 — 한국어 자동 감지 또는 99개 언어 중 수동 선택. 여러 화자가 있는 경우 화자 분리 활성화 (Speaker 1, Speaker 2 자동 라벨). (3) TXT, DOCX, SRT, VTT, JSON 형식으로 다운로드. 처리 시간은 음성 1시간당 5-15분. 첫 30분 무료, 카드 불필요.

정말 무료인가요?

네, 30분 무료 (카드 불필요, 회원가입만). 5가지 형식 (TXT/DOCX/SRT/VTT/JSON) 모두 워터마크 없이 다운로드 가능. 경쟁사 비교: Notta는 월 120분 무료지만 정확도 검증 안됨, Naver Clova Note는 월 300분 무료 (한국어 특화이지만 국내 사용에만 최적), 로컬 Whisper는 무제한 무료지만 GPU와 Python 지식 필요. 짧은 음성 파일 한 개라면 저희 무료 티어로 충분합니다. 지속적 사용에는 월 2달러부터 시작하는 유료 플랜이 필요합니다.

한국어 정확도는 어느 정도인가요?

한국어는 Whisper Large-v3의 Tier 1 언어로, OpenAI FLEURS 벤치마크에서 문자 오류율 (CER) 5.3% — 영어 수준에 근접합니다. 실전 성능: 스튜디오 녹음이나 팟캐스트 (94-96%), Zoom/Teams 회의 녹음 (91-95%), 스마트폰 근접 녹음 (92-95%), 배경 소음이 있는 환경 (78-88%). 고유명사나 전문용어는 오디오 품질과 무관하게 20-30% 오류율이 발생하므로 발행용 컨텐츠는 시간당 5-15분의 검수를 계획하세요.

방언 (경상도, 전라도, 제주도) 지원되나요?

기본 지원되지만 정확도 감소가 있습니다. Whisper Large-v3는 표준 한국어 (서울 방언)를 주로 학습했으며, 지역 방언 데이터는 코퍼스에 상당하지만 비중이 낮습니다. 경상도, 전라도, 제주도, 강원도 등 지역 방언에서는 일반적으로 Tier 1 수준보다 3-5% 정확도가 감소합니다 — 즉 94-96% 대신 89-92%. 표준 한국어에는 페널티가 없습니다. 강한 방언 자료의 경우 수동 검수 시간을 더 여유있게 계획하세요.

최대 파일 크기는 얼마인가요?

파일당 최대 5GB, 최대 10시간의 오디오 — 긴 강의, 하루 종일의 회의, 완전한 팟캐스트 아카이브를 커버합니다. 또한 최대 50개 파일을 병렬로 업로드할 수 있으며 각 파일은 독립적으로 처리됩니다 (가장 느린 파일을 기다릴 필요 없음). 비교: Zamzar는 무료 200MB / 유료 1GB, ElevenLabs는 3GB, HappyScribe는 4GB, OpenAI Whisper API는 25MB만. 5GB를 초과하는 파일은 LosslessCut (무료) 등으로 분할 후 트랜스크립트를 결합하세요.

여러 화자를 구분할 수 있나요?

네, 화자 분리 (Diarization) 기능이 자동으로 최대 10명의 화자를 식별합니다. 각 화자는 Speaker 1, Speaker 2 등으로 라벨링되며 편집기에서 실제 이름으로 변경할 수 있습니다. 2인 인터뷰, 3-5명 원탁 토론, 팀 회의에서 잘 작동합니다. 회의실에서 화자들이 멀리 떨어져 있거나 발언이 크게 겹치는 경우 분리 정확도가 떨어질 수 있지만 라벨 자체는 수동 검수의 기반으로 유용합니다. 화자 분리는 모든 유료 플랜에 추가 비용 없이 포함됩니다.

데이터는 어디서 처리되나요?

AWS eu-west-2 (런던, EU 관할권)에서 처리되며 전송 중 TLS 1.2+ 암호화, 저장 시 AES-256 암호화가 적용됩니다. 귀하의 오디오 데이터로 AI 모델을 학습시키지 않습니다. 언제든지 파일과 계정을 삭제할 수 있습니다. 전문적 용도 (법률사무소, 언론사, 의료, HR)의 경우 요청 시 DPA (Data Processing Agreement)를 제공하며 GDPR 및 한국 개인정보보호법 요구사항을 충족합니다. Otter, Rev, Descript, Sonix 등 대안은 미국에 호스팅되어 국제 데이터 이전 시 표준계약조항 (SCC)이 필요합니다.

SRT 자막으로 내보낼 수 있나요?

네. 한 번의 처리로 5가지 형식을 얻을 수 있습니다: TXT (일반 텍스트), DOCX (타임스탬프와 화자 라벨이 있는 Word), SRT (YouTube, Premiere, DaVinci, CapCut, VLC용 동기화된 자막), VTT (HTML5 <track> 요소 및 HLS 스트리밍용) 및 JSON (단어 수준 타임스탬프 포함 구조화 데이터). 각 형식마다 오디오를 재처리할 필요가 없습니다.

Naver Clova Note와 비교하면 어떻게 다른가요?

각각 장단점이 있습니다. Naver Clova Note는 순수 한국어 국내 사용에 최적화되어 있으며 실시간 회의 텍스트 변환에 강점이 있습니다. VexaScribe는 (1) 99개 언어 지원 + 133개 대상 언어 번역 (다국어 팀), (2) 최대 50개 파일 배치 처리, (3) EU 호스팅 + DPA (다국적 기업 컴플라이언스), (4) 5가지 내보내기 형식 강점이 있습니다. 정직하게: 순수 국내 한국어 회의에는 Clova, 다국어 팀 및 대량 파일 및 EU 데이터 규정 준수가 필요한 경우 VexaScribe입니다.

등록 없이 사용 가능한가요?

30분 무료 티어도 회원가입이 필요합니다 (이메일 + 비밀번호, 카드 불필요). 이는 (1) 자동화된 남용을 방지하고 (2) 다양한 형식으로 손실 없이 트랜스크립트를 다운로드할 수 있도록 하기 위함입니다. 일부 도구는 "등록 없음"을 광고하지만 매우 짧은 파일로 제한하거나 워터마크를 삽입하거나 내보내기를 제한합니다. VexaScribe 등록은 30초 걸리며 5가지 완전한 형식, 기록 저장, 부분 트랜스크립션 재개 기능을 잠금 해제합니다.

지금 무료로 음성 텍스트 변환 시작

30분 무료, 카드 불필요. 모든 내보내기 형식. EU 호스팅.