Aggiornato al 17 agosto 2026

Trascrizione Audio in Testo — AI in Italiano, Gratis Online

La trascrizione audio con AI trasforma file audio in testo utilizzando Whisper Large-v3, che raggiunge il 94-96% di precisione sull'italiano pulito (Tier 1, benchmark FLEURS di OpenAI). VexaScribe offre 30 minuti gratis senza carta, esportazione in TXT/DOCX/SRT/VTT/JSON, hosting AWS Londra conforme al GDPR, e supporta file fino a 5 GB o 10 ore. Serve sia per sbobinare lezioni universitarie che per trascrivere interviste, riunioni, podcast e note vocali.

30 min gratis94-96 % in italianoGDPR / hosting UEFino a 5 GB / 10 h

Come trascrivere un audio in testo in 3 passi

Dal file caricato alla trascrizione pronta nel tempo che serve per un caffè.

  1. 1

    Carica il file audio

    Trascina MP3, M4A, WAV, OPUS, OGG, FLAC nell'area di caricamento. Fino a 5 GB e 10 ore per file. I primi 30 minuti sono gratis.

  2. 2

    Scegli la lingua o lascia rilevare in automatico

    Rilevamento automatico per italiano pulito. O seleziona "Italiano" tra 99 lingue. Attiva la diarizzazione se l'audio ha più speaker — il sistema etichetta Speaker 1, Speaker 2, ecc.

  3. 3

    Scarica in TXT, DOCX, SRT o VTT

    In 5-15 minuti per ora di audio avrai il risultato. Scegli TXT (puro), DOCX (con timestamp), SRT/VTT (sottotitoli) o JSON (strutturato). Tutti e cinque i formati da un solo processamento.

Da audio a testo: cosa fa la trascrizione AI

Passare da audio a testo — o da voce a testo — significa dare in pasto a un modello di intelligenza artificiale un file audio (MP3, WAV, M4A, OPUS, OGG) e riceverne indietro una versione scritta, con punteggiatura, maiuscole, e opzionalmente timestamp ed etichette di chi parla. Non è dettatura in tempo reale (per cui esiste il microfono del sistema operativo), è trascrizione asincrona: carichi il file, l'AI ci lavora sopra, tu ricevi il testo pronto.

Il modello che sta sotto VexaScribe è Whisper Large-v3, rilasciato da OpenAI nel settembre 2023 e addestrato su circa 5 milioni di ore di audio multilingue. L'italiano è classificato Tier 1 — la stessa fascia dell'inglese, dello spagnolo, del francese — con Word Error Rate del 4-6% nel benchmark FLEURS. In pratica: su audio pulito 94-96% delle parole trascritte sono corrette; nomi propri e termini tecnici hanno errore più alto e vanno rivisti a mano.

A differenza di un convertitore audio-testo generico (es. servizi che usano modelli più leggeri come Whisper Small o motori proprietari degli anni 2010), Whisper Large-v3 gestisce voci sovrapposte, accenti forti, rumore moderato e passaggi in altre lingue senza rompersi. Questo è il motivo per cui la stessa infrastruttura serve sia il giornalista che trascrive un'intervista dal registratore, sia lo studente che carica una lezione universitaria di 90 minuti.

Sbobinare lezioni universitarie: guida per studenti

Sbobinare viene dall'epoca in cui le lezioni si registravano su bobine magnetiche e la trascrizione consisteva letteralmente nel "s-bobinare" il nastro per riscrivere il contenuto a mano. Oggi il termine è sopravvissuto quasi esclusivamente nel gergo universitario italiano: sbobinare una lezione = trasformare la registrazione audio della lezione in testo studiabile. Nessun altro Paese ha una parola dedicata a questa attività.

Workflow per una lezione da 90 minuti

  1. Registra la lezione con il microfono dello smartphone (iPhone Memo Vocali salva in .m4a, Android Registratore salva in .m4a o .opus). Piazza il telefono a 1-2 metri dal docente; evita di lasciarlo in fondo all'aula.
  2. Trasferisci il file al PC via AirDrop (Mac) o cavo USB, oppure carica direttamente dal browser mobile su VexaScribe.
  3. Carica il file nell'area di upload — 90 minuti = ~85 MB in .m4a, ben sotto il limite dei 5 GB.
  4. Attendi 8-15 minuti. Whisper Large-v3 processa 1 ora di audio in 5-10 minuti circa.
  5. Scarica in DOCX per rileggere e sottolineare in Word, o in TXT per Notion/Google Docs. I timestamp restano incorporati.

App per sbobinare: quanto costa a uno studente

Il conto è concreto. Un semestre universitario tipico = 6 esami × ~15 lezioni da 90 minuti = 90 lezioni = ~135 ore di audio. Numeri:

  • Tier gratuito VexaScribe (30 min una tantum): copre 1 lezione da 30 minuti. Utile per testare la qualità prima di pagare.
  • Starter 2 $/mese (~1,85 €, 200 min/mese): copre 2 lezioni da 90 min al mese. Sufficiente per uno studente che sbobina solo i corsi difficili.
  • Basic 5 $/mese (~4,60 €, 1.000 min/mese): copre 11 lezioni da 90 min al mese. Copre un semestre intero di 2-3 corsi in parallelo.
  • Pro 10 $/mese (~9,20 €, 2.500 min/mese): copre 27 lezioni da 90 min al mese. Per chi sbobina tutto il corso di laurea.

Alternative: Sbobina.it (servizio italiano brand-exact, dal nome esplicito, ~5-15 €/mese) o Whisper self-host (gratis illimitato ma richiede GPU e Python — impraticabile per la maggior parte degli studenti). Aranzulla ha una guida dettagliata su "come sbobinare un audio" che copre anche opzioni non-AI.

App per trascrivere audio: cosa cercare

Cercare "app per trascrivere audio", "sito per trascrivere audio" o "programma per trascrivere audio" restituisce decine di risultati. Non tutti sono equivalenti. I sei criteri che distinguono uno strumento serio da uno superficiale:

  • Modello dichiarato: chi usa Whisper Large-v3 lo dice. Chi scrive vagamente "AI proprietaria" spesso monta modelli più vecchi o meno accurati. VexaScribe usa Whisper Large-v3 senza modifiche.
  • Precisione italiana verificata: cerca numeri (WER o accuratezza), non aggettivi. "Alta precisione" non è misurabile; "94-96% su audio pulito, FLEURS 4-6%" sì.
  • Dove viene processato l'audio: hosting EU vs USA cambia lo scenario GDPR. Per audio di clienti, pazienti, fonti giornalistiche, hosting UE non è opzionale.
  • Formati di esportazione: TXT è il minimo. Sottotitoli SRT/VTT e JSON strutturato con timestamp separano gli strumenti veri da quelli-vetrina.
  • Limite file reale: Whisper API di OpenAI si ferma a 25 MB. Molti wrapper "gratis" ereditano quel limite senza dirlo. VexaScribe accetta fino a 5 GB / 10 ore per file.
  • Tier gratuito onesto: 10-30 minuti gratis senza carta = onesto. "Prova gratuita 7 giorni" con auto-addebito = trappola comune.

I convertitori vocali in testo (Google Speech-to-Text, Azure Speech) sono API per sviluppatori — funzionano ma richiedono codice e chiave AWS/GCP. Per un utente non-developer, un'app browser con drag-and-drop è la scelta pratica. Se sei sviluppatore e vuoi integrare l'output in una pipeline, VexaScribe esporta JSON con timestamp al livello di parola.

Trascrizione audio gratis: cosa è davvero incluso

Tutti gli strumenti dicono "gratis". Confronto onesto di cosa include ciascun livello gratuito, senza marketing.

StrumentoLivello gratuito realeCartaEsportazioniNote
VexaScribe30 min gratis (una volta)NoTXT / DOCX / SRT / VTT / JSONTutti i formati senza filigrana
CanvaIntegrato in Canva free/ProNoTXT / SRTUpsell verso Canva Pro
Vidnoz30 min lifetime (una tantum)NoTXT / SRTCuota una sola volta, non rinnovabile
Monica30 min solo nuovi utentiNoTXT / JSONSolo primo accesso
TranscriSenza registrazioneNoTXTLimitato a file corti, no export multiformato
Whisper locale (open source)IllimitatoNoLibero (dipende da script)Richiede GPU e Python

Quando il livello gratuito basta

Un audio singolo breve (intervista di 30 min, lezione, memo vocale). Il nostro livello gratuito di 30 min copre esattamente quel caso senza filigrana né limiti di formato.

Quando serve un piano a pagamento

Uso continuo (podcast settimanale, riunioni frequenti, archivio storico). Starter a 2 $/mese (200 min) copre un professionista solo; Basic 5 $/mese (1.000 min) la maggior parte dei creator.

Precisione della trascrizione audio in italiano (numeri reali)

L'italiano è una lingua Tier 1 di Whisper Large-v3, con tasso di errore parole (WER) del 4-6 % nel benchmark FLEURS di OpenAI — livello quasi paragonabile all'inglese. Nella pratica il risultato dipende dalla qualità dell'audio originale.

FontePrecisioneNota
Audio di studio o podcast professionale (microfono a condensatore)94-96 %Miglior scenario — poca revisione necessaria
Zoom / Teams / Meet esportato in audio90-94 %Compressione toglie qualche punto
Registrazione con smartphone in sala tranquilla92-95 %iPhone/Android con voce vicino al micro
Sala conferenze con più speaker85-91 %Distanza e sovrapposizione abbassano la precisione
Registrazione con rumore di fondo (caffè, strada)78-88 %Rumore ambiente forte compromette il segnale
Digitalizzazione da cassetta o vinile70-82 %Saturazione del nastro e rumore di fondo

Italiano standard vs dialetti regionali

Whisper Large-v3 è addestrato principalmente su italiano standard (base toscana). Per dialetti marcati — napoletano, siciliano, veneziano, sardo, dialetti calabresi — la precisione tipicamente scende 3-5 punti sotto il Tier 1: 89-92 % invece del 94-96 %. Per italiano del Nord e Centro-Italia standard non c'è penalità. Per materiale con forte dialetto, pianifica una revisione manuale più lunga.

Fonte: OpenAI Whisper paper (arXiv:2212.04356), Appendice D, Tabella 13 FLEURS. Dettagli su how accurate is Whisper (pagina in inglese con tabella completa di 99 lingue).

Formati supportati e limiti tecnici

Carica direttamente il tuo file audio — non serve convertirlo in WAV o MP3 prima. Supportiamo tutti i formati audio comuni.

.mp3

Formato principale — il più comune

.m4a

Registrazioni iPhone / iPad (Memo Vocali)

.wav

Senza compressione — studio professionale

.opus

WhatsApp, Discord, streaming leggero

.ogg

Firefox, open source

.flac

Senza perdita, file grande

.aac

YouTube, iTunes, streaming

.aiff

Mac / audio professionale

.wma

Windows Media Audio (legacy)

Dimensione massima

5 GB

Per file

Durata massima

10 ore

Per file

Batch parallelo

50 file

In parallelo

Formati di esportazione: TXT, DOCX, SRT, VTT, JSON

Tutti e cinque i formati escono dallo stesso processamento — non serve ri-processare l'audio per cambiare formato.

.txt — Testo puro

Per copiare in Word, Google Docs, Notion o qualsiasi editor.

.docx — Word con formattazione

Timestamp, etichette speaker, pronto per revisione e invio.

.srt — Sottotitoli universali

Compatibile con YouTube, Premiere, DaVinci Resolve, Final Cut, CapCut, VLC.

.vtt — Sottotitoli HTML5

Formato WebVTT per l'elemento <track>, streaming HLS e player web moderni.

.json — Dati strutturati

Timestamp al livello di parola + ID speaker, ideale per developer e pipeline personalizzate.

Se il tuo obiettivo specifico è creare sottotitoli per video, la nostra pagina dedicata è /it/generatore-sottotitoli.

Privacy e GDPR: dove viene processato il tuo audio

I file vengono processati in AWS eu-west-2 (Londra, spazio giuridico UE), con cifratura TLS 1.2+ in transito e AES-256 a riposo. Non addestriamo modelli AI con i tuoi dati. Puoi cancellare file e account in qualsiasi momento.

Per uso professionale (studi legali, giornalismo con protezione delle fonti, sanità, HR, pubbliche amministrazioni) offriamo un contratto DPA (Data Processing Agreement) su richiesta, conforme al GDPR e alla normativa italiana sulla privacy. Alternative come Otter, Rev, Descript, Sonix ed Evernote hostano negli Stati Uniti — per trasferimenti internazionali di dati personali servono le SCC (Standard Contractual Clauses).

Prezzi in euro

Fatturazione in USD; conversione indicativa a 1 $ ≈ 0,92 € (agosto 2026, tasso giornaliero variabile).

Starter

$2

≈ 1,85 €/mese

200 min/mese

Basic

$5

≈ 4,60 €/mese

1.000 min/mese

Pro

$10

≈ 9,20 €/mese

2.500 min/mese

Studio

$20

≈ 18,40 €/mese

6.000 min/mese

Vedi tutti i dettagli sulla pagina prezzi →

Casi d'uso frequenti della trascrizione audio

Sei contesti in cui gli utenti italiani processano audio con VexaScribe.

Giornalismo e interviste

Registra l'intervista con lo smartphone, carica come MP3, estrai citazioni con timestamp. Hosting GDPR per protezione delle fonti (LOPDGDD equivalente italiano).

Podcast e content creation

Converti gli episodi in show notes SEO, bozze di articoli blog, clip per social. La diarizzazione separa host e ospiti automaticamente.

Università e studio

Registra le lezioni in MP3, trascrivile, rendile ricercabili per la preparazione degli esami. Utile anche per docenti che preparano dispense.

Riunioni e verbali

Esporta la registrazione di Zoom, Teams o Google Meet come audio e convertila in verbale strutturato con speaker identificati. Fino a 10 speaker riconosciuti automaticamente.

Studi legali e compliance

Consulti con clienti, deposizioni, registrazioni di udienze con DPA disponibile e dati in UE. Per verbatim legale certificato, resta Rev umano lo standard.

Ricerca qualitativa

Interviste in profondità e focus group pronti per NVivo, ATLAS.ti o MAXQDA. Esportazione in DOCX o JSON con timestamp al livello di parola.

Quando scegliere un altro strumento invece di VexaScribe

Siamo onesti: ci sono casi in cui un altro strumento funziona meglio. Questi sono i tre principali.

Descript — per editare video e trascrizione nello stesso ambiente

Se il tuo flusso è "registro video → edito per testo → pubblico", Descript (16 $/mese) integra editor video e trascrizione in una sola app. VexaScribe si specializza in trascrizione batch con esportazione multiformato, non in editing.

Rev umano — per verbatim di qualità legale o notarile

Quando serve una trascrizione parola-per-parola certificabile per tribunali, atti notarili o casi regolati, Rev con revisori umani (1,50 $/min) resta lo standard. L'IA arriva al 96 % — il restante 4 % conta in contesti legali.

Whisper locale — per controllo totale senza dipendenza cloud

Se il contenuto non può uscire dalla tua rete (sanità regolata, difesa, proprietà intellettuale critica), Whisper Large-v3 si può installare in locale con una GPU decente. Gratis per sempre, precisione equivalente, ma infrastruttura e manutenzione a tuo carico.

Domande frequenti

Quanto costa trascrivere un audio con VexaScribe?

I primi 30 minuti sono gratis, senza carta di credito. Da lì i piani partono da 2 $/mese (Starter, ~1,85 €, 200 minuti) fino a 20 $/mese (Studio, 6.000 minuti). Il costo per minuto va da 0,01 $ (Starter) a 0,003 $ (Studio) — molto più economico della trascrizione umana (Rev costa 1,50 $/min) e competitivo rispetto a Otter (16,99 $/mese per 1.200 minuti) o HappyScribe (15-72 €/mese). Tutti i piani includono i cinque formati di esportazione (TXT/DOCX/SRT/VTT/JSON) senza restrizioni.

È davvero gratis o c'è la trappola?

Sì, 30 minuti gratis veri — senza carta, senza filigrana, con esportazione completa in TXT/DOCX/SRT/VTT/JSON. Confronto con i concorrenti: Canva integra il free tier nell'upsell di Canva Pro; Vidnoz limita a 30 min di vita (una tantum); Monica offre 30 min ma solo ai nuovi utenti; Evernote richiede piano a pagamento per esportazioni complete; Transcri è senza registrazione ma limitato a file corti. Per un audio singolo breve, il nostro nivel gratuito basta. Per uso continuo serve un piano a pagamento — senza trucchi.

Che precisione ha la trascrizione in italiano?

L'italiano è una lingua Tier 1 di Whisper Large-v3, con tasso di errore parole (WER) del 4-6% nel benchmark FLEURS di OpenAI — livello quasi paragonabile all'inglese. Nella pratica: 94-96% di precisione su audio pulito di studio o podcast professionale; 90-94% su riunioni Zoom/Teams/Meet esportate (gli artefatti di compressione tolgono qualche punto); 92-95% su registrazioni con smartphone in sala tranquilla; 78-88% con rumore di fondo forte (caffè, strada, ufficio open space). I nomi propri e i termini tecnici hanno 20-30% di errore indipendentemente dalla qualità audio — pianifica 5-15 minuti di revisione per ora di audio per contenuto pubblicabile.

Qual è la differenza tra trascrivere e sbobinare un audio?

Nessuna differenza tecnica — descrivono la stessa operazione: trasformare un file audio in testo. "Sbobinare" è il termine italiano nato in epoca analogica (dalla bobina magnetica che veniva letteralmente "sbobinata" per essere trascritta a mano) ed è oggi il registro usato quasi esclusivamente in ambito universitario: studenti che sbobinano lezioni registrate per prepararsi agli esami. "Trascrivere" è il registro professionale usato da giornalisti, avvocati, ricercatori, podcaster. Il processo con VexaScribe è identico: carichi il file audio, l'AI produce il testo, esporti in TXT/DOCX. Se stai cercando "come sbobinare un audio" e sei uno studente, sei nel posto giusto: il tier gratuito da 30 minuti copre una lezione intera di 30-45 minuti, e il piano Starter da 2 $/mese (200 minuti) copre 3-4 lezioni da 60 minuti al mese.

Funziona con i dialetti italiani (napoletano, siciliano, veneziano, sardo)?

Sì con calo di precisione. Whisper Large-v3 è addestrato principalmente su italiano standard (base toscana), con una quota significativa ma minoritaria di dialetti nel corpus. Per napoletano, siciliano, veneziano, sardo e altri dialetti marcati la precisione tipicamente scende 3-5 punti sotto il livello Tier 1 — quindi 89-92% invece del 94-96%. Per italiano del Nord e Centro-Italia standard non c'è penalità. Per materiale con forte dialetto, pianifica una revisione manuale più lunga o pre-elabora l'audio.

Qual è la dimensione massima di audio che posso caricare?

5 GB per file, con un massimo di 10 ore di durata — copre podcast lunghi, conferenze intere, giornate di lavoro complete. Inoltre puoi caricare fino a 50 file audio in parallelo, ognuno viene processato indipendentemente (non aspetti il più lento). Confronto: Zamzar limita a 200 MB gratis / 1 GB a pagamento, ElevenLabs a 3 GB, HappyScribe a 4 GB, la API di OpenAI Whisper solo 25 MB. Se il tuo file supera 5 GB, dividilo con LosslessCut (gratis) in due parti e concatena le trascrizioni.

Si può trascrivere un audio con più interlocutori?

Sì, con la diarizzazione automatica attivata. VexaScribe identifica fino a 10 speaker in un audio, li etichetta come Speaker 1, Speaker 2, ecc., e permette di rinominarli nell'editor. Funziona bene con interviste a due persone, tavole rotonde di 3-5 persone, riunioni di squadra. Su audio di conferenza con speaker lontani o molto sovrapposti la precisione di separazione cala, ma le etichette rimangono utili come impalcatura per la revisione manuale. La diarizzazione è inclusa in tutti i piani a pagamento senza costi aggiuntivi.

Dove viene processato il mio audio? È conforme al GDPR?

I file vengono processati in AWS eu-west-2 (Londra, spazio giuridico UE), con cifratura TLS 1.2+ in transito e AES-256 a riposo. Non addestriamo modelli AI con i tuoi dati. Puoi cancellare file e account in qualsiasi momento. Per uso professionale (studi legali, giornalismo con protezione delle fonti, sanità, HR) offriamo un contratto DPA (Data Processing Agreement) su richiesta, conforme al GDPR e alla normativa italiana. Alternative come Otter, Rev, Descript, Sonix e Evernote hostano negli USA — per trasferimenti internazionali di dati personali servono le SCC (Standard Contractual Clauses).

Posso esportare la trascrizione come SRT per i sottotitoli?

Sì. Da un solo processamento ottieni cinque formati: TXT (testo puro), DOCX (Word con timestamp ed etichette speaker), SRT (sottotitoli sincronizzati per YouTube, Premiere, DaVinci, CapCut, VLC), VTT (sottotitoli HTML5 nativi per l'elemento <track>) e JSON (strutturato con timestamp al livello di parola). Non serve ri-processare l'audio per ogni formato. Se il tuo obiettivo è creare sottotitoli per video, la nostra pagina dedicata è /it/generatore-sottotitoli.

È meglio VexaScribe o Canva / Vidnoz / Descript / Otter per trascrivere audio?

Dipende dal flusso di lavoro. VexaScribe se cerchi trascrizione batch con esportazione multiformato (TXT/DOCX/SRT/VTT/JSON), 99 lingue, hosting UE, al miglior prezzo (2-20 $/mese). Canva se usi già l'ecosistema Canva per la grafica e ti va bene l'upsell verso Pro. Vidnoz per un audio singolo breve (30 min lifetime). Descript (16 $/mese) se editi video e trascrizione nella stessa app. Otter per riunioni live con cattura calendario automatica. Rev umano (1,50 $/min) solo se serve verbatim per uso legale o notarile.

Posso trascrivere audio senza registrarmi?

Per il livello gratuito di 30 minuti chiediamo la registrazione (email + password, senza carta), sia per prevenire abuso automatizzato sia per permettere di scaricare la trascrizione in più formati senza perdite. Strumenti come Transcri offrono "senza registrazione" ma limitano a file molto corti e spesso inseriscono filigrana o restringono le esportazioni. La registrazione su VexaScribe richiede 30 secondi e sblocca i cinque formati completi, il salvataggio della cronologia e la possibilità di riprendere trascrizioni parziali.

Inizia a trascrivere audio gratis ora

30 minuti gratis, senza carta. Tutti i formati di esportazione. Hosting GDPR in UE.