Trascrivere Audio in Testo — Gratis, in Italiano
Carica un MP3, un WAV, un M4A, un video o una nota vocale e riavrai il testo con i parlanti separati e le marche temporali. I primi 5 minuti si trascrivono qui, senza account.
Trascina qui il tuo file audio
oppure clicca per sceglierlo
Audio: MP3 · WAV · M4A · FLAC · OGG · AAC · AIFF · WMA · AMR · OPUS
Video: MP4 · MOV · AVI · MKV · WebM · FLV · WMV
Fino a 200 MB · i primi 5 minuti gratis, senza account
Anteprima gratuita di 5 minuti · senza account · file fino a 200 MB · registrati gratis per 30 minuti e file fino a 5 GB
A cura della redazione VexaScribe · Aggiornato il
Come trascrivere un audio in testo in 3 passi
Dal file caricato alla trascrizione pronta nel tempo che serve per un caffè.
- 1
Carica il file audio
Trascina MP3, M4A, WAV, OPUS, OGG, FLAC nell'area di caricamento. Fino a 5 GB per file. I primi 30 minuti sono gratis.
- 2
Scegli la lingua o lascia rilevare in automatico
Rilevamento automatico per italiano pulito. O seleziona "Italiano" tra 99 lingue. Attiva la diarizzazione se l'audio ha più speaker — il sistema etichetta Speaker 1, Speaker 2, ecc.
- 3
Scarica in TXT, DOCX, SRT o VTT
Un'ora di audio richiede circa 2 minuti con il modello premium e 3-5 con lo standard. Scegli TXT (puro), DOCX (con timestamp), SRT/VTT (sottotitoli) o JSON (strutturato). Tutti e cinque i formati da un solo processamento.
Sbobinare lezioni universitarie: guida per studenti
Sbobinare viene dall'epoca in cui le lezioni si registravano su bobine magnetiche e la trascrizione consisteva letteralmente nel "s-bobinare" il nastro per riscrivere il contenuto a mano. Oggi il termine è sopravvissuto quasi esclusivamente nel gergo universitario italiano: sbobinare una lezione = trasformare la registrazione audio della lezione in testo studiabile. Nessun altro Paese ha una parola dedicata a questa attività.
Workflow per una lezione da 90 minuti
- Registra la lezione con il microfono dello smartphone (iPhone Memo Vocali salva in .m4a, Android Registratore salva in .m4a o .opus). Piazza il telefono a 1-2 metri dal docente; evita di lasciarlo in fondo all'aula.
- Trasferisci il file al PC via AirDrop (Mac) o cavo USB, oppure carica direttamente dal browser mobile su VexaScribe.
- Carica il file nell'area di upload — 90 minuti = ~85 MB in .m4a, ben sotto il limite dei 5 GB.
- Attendi qualche minuto. Una lezione da 90 minuti richiede circa 3 minuti con il modello premium, 5-8 con lo standard.
- Scarica in DOCX per rileggere e sottolineare in Word, o in TXT per Notion/Google Docs. I timestamp restano incorporati.
App per sbobinare: quanto costa a uno studente
Il conto è concreto. Un semestre universitario tipico = 6 esami × ~15 lezioni da 90 minuti = 90 lezioni = ~135 ore di audio. Numeri:
- Tier gratuito VexaScribe (30 min una tantum): copre 1 lezione da 30 minuti. Utile per testare la qualità prima di pagare.
- Starter 2 $/mese (~1,85 €, 200 min/mese): copre 2 lezioni da 90 min al mese. Sufficiente per uno studente che sbobina solo i corsi difficili.
- Basic 5 $/mese (~4,60 €, 1.000 min/mese): copre 11 lezioni da 90 min al mese. Copre un semestre intero di 2-3 corsi in parallelo.
- Pro 10 $/mese (~9,20 €, 2.500 min/mese): copre 27 lezioni da 90 min al mese. Per chi sbobina tutto il corso di laurea.
Alternative: Sbobina.it (servizio italiano brand-exact, dal nome esplicito, ~5-15 €/mese) o Whisper self-host (gratis illimitato ma richiede GPU e Python — impraticabile per la maggior parte degli studenti). Aranzulla ha una guida dettagliata su "come sbobinare un audio" che copre anche opzioni non-AI.
App per trascrivere audio: cosa cercare
Cercare "app per trascrivere audio", "sito per trascrivere audio" o "programma per trascrivere audio" restituisce decine di risultati. Non tutti sono equivalenti. I sei criteri che distinguono uno strumento serio da uno superficiale:
- Quale modello gira sotto: la maggior parte dei servizi non lo dichiara — scrive «IA avanzata» o «il nostro motore» e basta. Non è di per sé un difetto, ma senza quel dato non puoi confrontare due strumenti né cercare benchmark indipendenti. Noi usiamo Whisper Large v3 sul livello standard; sul premium un motore commerciale di cui non pubblichiamo il fornitore.
- Da dove viene la percentuale: quando un servizio dichiara una precisione, apri la fonte. Deve dire su quale corpus è stata misurata, con quale modello e in quale lingua. Una percentuale senza metodo — o con una fonte che parla di un'altra lingua — non è un dato, è un'affermazione.
- Dove viene processato l'audio: hosting EU vs USA cambia lo scenario GDPR. Per audio di clienti, pazienti, fonti giornalistiche, hosting UE non è opzionale.
- Formati di esportazione: TXT è il minimo. Sottotitoli SRT/VTT e JSON strutturato con timestamp separano gli strumenti veri da quelli-vetrina.
- Limite file reale: Whisper API di OpenAI si ferma a 25 MB. Molti wrapper "gratis" ereditano quel limite senza dirlo. VexaScribe accetta fino a 5 GB per file, senza limite di durata.
- Tier gratuito onesto: 10-30 minuti gratis senza carta = onesto. "Prova gratuita 7 giorni" con auto-addebito = trappola comune.
I convertitori vocali in testo (Google Speech-to-Text, Azure Speech) sono API per sviluppatori — funzionano ma richiedono codice e chiave AWS/GCP. Per un utente non-developer, un'app browser con drag-and-drop è la scelta pratica. Se sei sviluppatore e vuoi integrare l'output in una pipeline, VexaScribe esporta JSON con timestamp al livello di parola.
Trascrizione audio gratis: cosa è davvero incluso
Tutti gli strumenti dicono "gratis". Confronto onesto di cosa include ciascun livello gratuito, senza marketing.
| Strumento | Livello gratuito reale | Carta | Esportazioni | Note |
|---|---|---|---|---|
| VexaScribe | 30 min gratis (una volta) | No | TXT / DOCX / SRT / VTT / JSON | Tutti i formati senza filigrana |
| Canva | Integrato in Canva free/Pro | No | TXT / SRT | Upsell verso Canva Pro |
| Vidnoz | 30 min lifetime (una tantum) | No | TXT / SRT | Cuota una sola volta, non rinnovabile |
| Monica | 30 min solo nuovi utenti | No | TXT / JSON | Solo primo accesso |
| Transcri | Senza registrazione | No | TXT | Limitato a file corti, no export multiformato |
| Whisper locale (open source) | Illimitato | No | Libero (dipende da script) | Richiede GPU e Python |
Quando il livello gratuito basta
Un audio singolo breve (intervista di 30 min, lezione, memo vocale). Il nostro livello gratuito di 30 min copre esattamente quel caso senza filigrana né limiti di formato.
Quando serve un piano a pagamento
Uso continuo (podcast settimanale, riunioni frequenti, archivio storico). Starter a 2 $/mese (200 min) copre un professionista solo; Basic 5 $/mese (1.000 min) la maggior parte dei creator.
Quale dei due modelli ti conviene
Usiamo due motori e puoi scegliere. Avere due livelli serve però solo se sai quando usarli: su audio facile la differenza si nota poco, su audio difficile molto.
| Modello | Che cos'è | 1 ora di audio |
|---|---|---|
| Standard | Whisper Large v3, il modello open source di OpenAI. È lo stesso motore dietro buona parte degli strumenti di questo settore, inclusi diversi gratuiti. | 3–5 min |
| Premium | Un motore commerciale su licenza, più preciso di Whisper nella nostra esperienza operativa, soprattutto con più parlanti e audio difficile. Non pubblichiamo il fornitore. | ~2 min |
| La tua registrazione | Scegli | Perché |
|---|---|---|
| Una voce sola, microfono vicino, senza rumore | Standard | È il caso in cui Whisper rende meglio. Il premium qui aggiunge poco. |
| Tre o più persone che si sovrappongono | Premium | È dove i due modelli si separano di più, soprattutto sulle etichette dei parlanti. |
| Dialetto marcato o forte accento regionale | Premium | L'italiano non standard è tra i casi più esigenti. |
| Lessico tecnico, medico o giuridico | Premium | I termini rari sono i primi a degradarsi. Rivedi comunque il testo. |
| Un file lungo, o un file per un solo dato | Standard | 3-5 minuti per ora e nessun minuto premium consumato. |
Nel dubbio parti dallo standard: sono tre minuti di attesa e ti dice già se il tuo audio è facile o difficile. Quando il risultato ha troppi nomi sbagliati o le etichette dei parlanti ballano, quello è il file che merita il premium.
Dirlo ad alta voce ha un costo commerciale evidente: il livello standard usa lo stesso modello aperto che potresti far girare tu, e preferiamo che tu lo sappia prima di pagare. Quello che aggiungiamo sopra Whisper è la separazione dei parlanti, i formati di esportazione, l'editor con i tempi cliccabili e l'interfaccia in italiano — e, al livello premium, un motore che non è open source.
Sul «95% di precisione»
Quasi tutti gli strumenti di questo settore dichiarano una percentuale di precisione. Quasi nessuno dice su quale audio l'ha misurata, con quale modello e contro quale trascrizione di riferimento. Una percentuale senza corpus e senza metodo non vuol dire niente: lo stesso sistema può fare 97% su un audiolibro e 78% su una riunione di quattro persone con un telefono in mezzo al tavolo.
Un esempio concreto
Uno dei servizi che compaiono in prima pagina per questa ricerca dichiara «95% di precisione» citando un paper su arXiv. Il paper esiste davvero ed è serio — ma valuta sistemi di riconoscimento vocale sul rumeno, su un corpus di parlato rumeno. Non contiene dati sull'italiano. La citazione dà autorevolezza a un numero che non sostiene.
Non lo scriviamo per fare polemica, ma perché è esattamente il controllo che conviene fare prima di scegliere uno strumento: apri la fonte e guarda se parla della tua lingua.
Per lo stesso motivo non pubblichiamo una nostra percentuale. Non abbiamo misurato il tasso di errore del nostro sistema su un corpus italiano con trascrizioni di riferimento, e dare un numero senza averlo fatto sarebbe lo stesso marketing che stiamo criticando. Quello che possiamo dirti è cosa sposta davvero il risultato sulla tua registrazione:
- 1
La distanza dal microfono
È il fattore che pesa di più, più del modello. Un telefono sul tavolo a un metro e un microfono a clip danno risultati diversi con lo stesso software. Se puoi cambiare una cosa sola, cambia questa.
- 2
Le voci sovrapposte
È il caso più difficile per qualunque sistema di diarizzazione, incluso il nostro. Se registri un gruppo, un microfono a testa migliora le etichette dei parlanti molto più che cambiare strumento.
- 3
Il dialetto e la variante regionale
I modelli di riconoscimento vocale sono addestrati soprattutto su italiano standard. Su napoletano, siciliano, veneto o sardo marcati il risultato peggiora in modo percepibile — non sappiamo dirti di quanto, perché non l'abbiamo misurato, ma mettilo in conto e prevedi una revisione più lunga.
- 4
Il lessico specialistico
Nomi propri, sigle, terminologia medica o giuridica: è lì che si concentrano gli errori da correggere a mano.
- 5
Il rumore di fondo e il bitrate
Musica, traffico e registrazioni sotto i 64 kbps degradano l'audio prima che il modello lo veda. Se puoi scegliere in fase di esportazione, alza la qualità.
Il modo onesto di decidere: trascrivi i primi 5 minuti del tuo file qui sopra, senza account, e guarda il risultato. È più informativo di qualunque percentuale — compresa la nostra. Per lavoro che viene pubblicato o che ha conseguenze legali, metti sempre in conto una revisione umana: nessuna IA di oggi sostituisce un trascrittore professionista su quel terreno.
Cosa puoi fare oltre alla trascrizione
La trascrizione è il punto di partenza, non la consegna. Tutto quello che segue gira sul file già elaborato: non si ricarica niente e non si consuma altro tempo di trascrizione.
Riassunto con IA — sei formati
Il riassunto si adatta al tipo di registrazione invece di restituire sempre lo stesso schema. Sono sei: generale, riunione, chiamata di vendita, intervista, lezione e podcast. Una riunione restituisce decisioni e attività con il minuto in cui sono state prese; una chiamata di vendita restituisce obiezioni e a che punto è la trattativa; una lezione restituisce concetti e terminologia.
Le attività escono con il minuto in cui sono state concordate, così puoi tornare all'audio e verificare chi ha detto cosa prima di assegnare il lavoro.
Fare domande alla trascrizione
Invece di rileggere un'ora di conversazione per cercare un dato, chiedi «quando hanno parlato del budget?» in linguaggio normale. La risposta cita il minuto da cui proviene, quindi puoi saltare a quel punto e verificarla — che è la differenza tra una risposta utile e una di cui bisogna fidarsi alla cieca.
Traduzione, su due livelli
Oltre 130 lingue, applicate alla trascrizione esistente mantenendo marche temporali ed etichette dei parlanti al loro posto. È proprio quello che si perde traducendo un sottotitolo per conto proprio: il testo si traduce ma smette di combaciare con il video.
Il livello standard è gratuito e immediato, e va bene per leggere o farsi un'idea. Il premium mantiene la terminologia coerente su tutta la registrazione — se un termine viene reso in un modo al minuto 3, viene reso uguale al minuto 50. Su una registrazione breve cambia poco; su una lezione di due ore è la differenza tra un testo pubblicabile e uno da ripassare da capo.
Prima di consegnare: cosa controllare
La trascrizione automatica sbaglia in punti prevedibili, e questo rende la revisione molto più veloce che rileggere tutto. Questi cinque spiegano la maggior parte di ciò che va storto in italiano, più o meno nell'ordine in cui conviene guardarli.
- 1
Le doppie
È la classe di errore più frequente in italiano e la più invisibile a una lettura veloce: «camino» invece di «cammino», «casa» invece di «cassa», «nono» invece di «nonno». Il testo resta grammaticale, quindi sopravvive a una scorsa distratta.
- 2
Nomi propri e marchi
Un nome che il modello non ha mai visto diventa la parola comune più vicina. Cerca ogni nome una volta sola e correggilo in tutte le occorrenze insieme.
- 3
Accenti e apostrofi
«Perché» senza accento, «è» scritto «e», «un'ora» scritto «un ora», «qual è» scritto «qual'è». Sono errori che cambiano il registro del testo e che un revisore umano nota subito.
- 4
Cifre, date e importi
«Sessanta» e «settanta» si distinguono per una sillaba atona, e un decimale sbagliato cambia una cifra di un ordine di grandezza. Controlla qualunque numero tu voglia citare.
- 5
L'attribuzione nei sovrapposti
Quando due persone parlano insieme le parole di solito sono giuste, ma l'etichetta del parlante può finire sul turno sbagliato. Controlla i punti in cui la conversazione accelera prima di citare qualcuno.
Per qualunque citazione destinata alla pubblicazione — giornalismo, ricerca, lavoro legale — riascolta l'audio al minuto della citazione prima che esca. Nell'editor è veloce: cliccando una parola la riproduzione salta a quel punto.
Come funzionano le etichette dei parlanti
I parlanti vengono separati automaticamente ed etichettati come Parlante 1, Parlante 2 e così via, nell'ordine in cui intervengono per la prima volta. Se ne rinomini uno nell'editor, la modifica si applica a tutte le sue righe in una volta.
Dove funziona bene
Da due a quattro persone che si alternano, registrate vicino al microfono, in una stanza senza troppo riverbero. Un'intervista normale o una riunione piccola sono vicine al caso migliore, e lì la separazione è affidabile abbastanza da citarne direttamente.
Dove si degrada
- • Sovrapposizioni: le parole di solito sopravvivono, l'etichetta no.
- • Voci simili: stesso registro e stesso accento sono più difficili da separare.
- • Audio telefonico: la banda stretta elimina buona parte di ciò che distingue una voce.
- • Gruppi numerosi: più persone ci sono, più le etichette slittano sugli interventi brevi.
La soluzione affidabile, quando il setup lo consente, è registrare ogni persona su una traccia e caricarle separatamente: così la separazione fa parte della registrazione invece di essere dedotta. Se non è possibile, controlla l'attribuzione nei punti in cui la conversazione accelera.
Formati supportati e limiti tecnici
Carica direttamente il tuo file audio — non serve convertirlo in WAV o MP3 prima. Supportiamo tutti i formati audio comuni.
.mp3Formato principale — il più comune
.m4aRegistrazioni iPhone / iPad (Memo Vocali)
.wavSenza compressione — studio professionale
.opusWhatsApp, Discord, streaming leggero
.oggFirefox, open source
.flacSenza perdita, file grande
.aacYouTube, iTunes, streaming
.aiffMac / audio professionale
.wmaWindows Media Audio (legacy)
Dimensione massima
5 GB
Per file
Durata massima
Nessun limite
Conta solo la dimensione
Batch parallelo
50 file
In parallelo
Formati di esportazione: TXT, DOCX, SRT, VTT, JSON
Tutti e cinque i formati escono dallo stesso processamento — non serve ri-processare l'audio per cambiare formato.
.txt — Testo puro
Per copiare in Word, Google Docs, Notion o qualsiasi editor.
.docx — Word con formattazione
Timestamp, etichette speaker, pronto per revisione e invio.
.srt — Sottotitoli universali
Compatibile con YouTube, Premiere, DaVinci Resolve, Final Cut, CapCut, VLC.
.vtt — Sottotitoli HTML5
Formato WebVTT per l'elemento <track>, streaming HLS e player web moderni.
.json — Dati strutturati
Timestamp al livello di parola + ID speaker, ideale per developer e pipeline personalizzate.
Se il tuo obiettivo specifico è creare sottotitoli per video, la nostra pagina dedicata è /it/generatore-sottotitoli.
Privacy e GDPR: dove viene processato il tuo audio
I file vengono processati in AWS eu-west-2 (Londra, spazio giuridico UE), con cifratura TLS 1.2+ in transito e AES-256 a riposo. Non addestriamo modelli AI con i tuoi dati. Puoi cancellare file e account in qualsiasi momento.
Per uso professionale (studi legali, giornalismo con protezione delle fonti, sanità, HR, pubbliche amministrazioni) offriamo un contratto DPA (Data Processing Agreement) su richiesta, conforme al GDPR e alla normativa italiana sulla privacy. Alternative come Otter, Rev, Descript, Sonix ed Evernote hostano negli Stati Uniti — per trasferimenti internazionali di dati personali servono le SCC (Standard Contractual Clauses).
Prezzi in euro
Fatturazione in USD. Gli importi in euro sono indicativi, calcolati a 1 $ ≈ 0,92 € — il cambio varia ogni giorno, quindi quello che paghi dipende dalla tua banca il giorno dell'addebito.
Starter
$2
≈ 1,85 €/mese
200 min/mese
Basic
$5
≈ 4,60 €/mese
1.000 min/mese
Pro
$10
≈ 9,20 €/mese
2.500 min/mese
Studio
$20
≈ 18,40 €/mese
6.000 min/mese
Quando scegliere un altro strumento invece di VexaScribe
Siamo onesti: ci sono casi in cui un altro strumento funziona meglio. Questi sono i tre principali.
Descript — per editare video e trascrizione nello stesso ambiente
Se il tuo flusso è "registro video → edito per testo → pubblico", Descript (16 $/mese) integra editor video e trascrizione in una sola app. VexaScribe si specializza in trascrizione batch con esportazione multiformato, non in editing.
Rev umano — per verbatim di qualità legale o notarile
Quando serve una trascrizione parola-per-parola certificabile per tribunali, atti notarili o casi regolati, Rev con revisori umani (1,50 $/min) resta lo standard. L'IA lascia sempre qualche errore, e in sede legale anche pochi errori contano.
Whisper locale — per controllo totale senza dipendenza cloud
Se il contenuto non può uscire dalla tua rete (sanità regolata, difesa, proprietà intellettuale critica), Whisper Large-v3 si può installare in locale con una GPU decente. Gratis per sempre, precisione equivalente, ma infrastruttura e manutenzione a tuo carico.
Domande frequenti
Quanto costa trascrivere un audio con VexaScribe?
I primi 30 minuti sono gratis, senza carta di credito. Da lì i piani partono da 2 $/mese (Starter, ~1,85 €, 200 minuti) fino a 20 $/mese (Studio, 6.000 minuti). Il costo per minuto va da 0,01 $ (Starter) a 0,003 $ (Studio) — molto più economico della trascrizione umana (Rev costa 1,50 $/min) e competitivo rispetto a Otter (16,99 $/mese per 1.200 minuti) o HappyScribe (15-72 €/mese). Tutti i piani includono i cinque formati di esportazione (TXT/DOCX/SRT/VTT/JSON) senza restrizioni.
È davvero gratis o c'è la trappola?
Sì, 30 minuti gratis veri — senza carta, senza filigrana, con esportazione completa in TXT/DOCX/SRT/VTT/JSON. Confronto con i concorrenti: Canva integra il free tier nell'upsell di Canva Pro; Vidnoz limita a 30 min di vita (una tantum); Monica offre 30 min ma solo ai nuovi utenti; Evernote richiede piano a pagamento per esportazioni complete; Transcri è senza registrazione ma limitato a file corti. Per un audio singolo breve, il nostro nivel gratuito basta. Per uso continuo serve un piano a pagamento — senza trucchi.
Che precisione ha la trascrizione in italiano?
Dipende molto più dalla tua registrazione che dal modello. Un file pulito, con un microfono vicino e una sola persona che parla, esce quasi pronto; rumore di fondo, dialetto marcato, lessico tecnico e voci sovrapposte lo peggiorano, in quest'ordine. Non pubblichiamo una percentuale perché non abbiamo misurato il tasso di errore su un corpus italiano di riferimento: prova i primi 5 minuti gratis e giudica sul tuo file.
Qual è la differenza tra trascrivere e sbobinare un audio?
Nessuna differenza tecnica — descrivono la stessa operazione: trasformare un file audio in testo. "Sbobinare" è il termine italiano nato in epoca analogica (dalla bobina magnetica che veniva letteralmente "sbobinata" per essere trascritta a mano) ed è oggi il registro usato quasi esclusivamente in ambito universitario: studenti che sbobinano lezioni registrate per prepararsi agli esami. "Trascrivere" è il registro professionale usato da giornalisti, avvocati, ricercatori, podcaster. Il processo con VexaScribe è identico: carichi il file audio, l'AI produce il testo, esporti in TXT/DOCX. Se stai cercando "come sbobinare un audio" e sei uno studente, sei nel posto giusto: il tier gratuito da 30 minuti copre una lezione intera di 30-45 minuti, e il piano Starter da 2 $/mese (200 minuti) copre 3-4 lezioni da 60 minuti al mese.
Funziona con i dialetti italiani (napoletano, siciliano, veneziano, sardo)?
Sì, con un calo di precisione. I modelli di riconoscimento vocale sono addestrati soprattutto su italiano standard, quindi su napoletano, siciliano, veneto o sardo marcati il risultato peggiora in modo percepibile. Non sappiamo quantificarlo — non lo abbiamo misurato — ma mettilo in conto e prevedi una revisione più lunga. Sul dialetto conviene il modello premium.
Qual è la dimensione massima di audio che posso caricare?
5 GB per file, senza limite di durata — copre podcast lunghi, conferenze intere, giornate di lavoro complete. Inoltre puoi caricare fino a 50 file audio in parallelo, ognuno viene processato indipendentemente (non aspetti il più lento). Confronto: Zamzar limita a 200 MB gratis / 1 GB a pagamento, ElevenLabs a 3 GB, HappyScribe a 4 GB, la API di OpenAI Whisper solo 25 MB. Se il tuo file supera 5 GB, dividilo con LosslessCut (gratis) in due parti e concatena le trascrizioni.
Si può trascrivere un audio con più interlocutori?
Sì, con la diarizzazione automatica attivata. VexaScribe identifica fino a 10 speaker in un audio, li etichetta come Speaker 1, Speaker 2, ecc., e permette di rinominarli nell'editor. Funziona bene con interviste a due persone, tavole rotonde di 3-5 persone, riunioni di squadra. Su audio di conferenza con speaker lontani o molto sovrapposti la precisione di separazione cala, ma le etichette rimangono utili come impalcatura per la revisione manuale. La diarizzazione è inclusa in tutti i piani a pagamento senza costi aggiuntivi.
Dove viene processato il mio audio? È conforme al GDPR?
I file vengono processati in AWS eu-west-2 (Londra, spazio giuridico UE), con cifratura TLS 1.2+ in transito e AES-256 a riposo. Non addestriamo modelli AI con i tuoi dati. Puoi cancellare file e account in qualsiasi momento. Per uso professionale (studi legali, giornalismo con protezione delle fonti, sanità, HR) offriamo un contratto DPA (Data Processing Agreement) su richiesta, conforme al GDPR e alla normativa italiana. Alternative come Otter, Rev, Descript, Sonix e Evernote hostano negli USA — per trasferimenti internazionali di dati personali servono le SCC (Standard Contractual Clauses).
Posso esportare la trascrizione come SRT per i sottotitoli?
Sì. Da un solo processamento ottieni cinque formati: TXT (testo puro), DOCX (Word con timestamp ed etichette speaker), SRT (sottotitoli sincronizzati per YouTube, Premiere, DaVinci, CapCut, VLC), VTT (sottotitoli HTML5 nativi per l'elemento <track>) e JSON (strutturato con timestamp al livello di parola). Non serve ri-processare l'audio per ogni formato. Se il tuo obiettivo è creare sottotitoli per video, la nostra pagina dedicata è /it/generatore-sottotitoli.
È meglio VexaScribe o Canva / Vidnoz / Descript / Otter per trascrivere audio?
Dipende dal flusso di lavoro. VexaScribe se cerchi trascrizione batch con esportazione multiformato (TXT/DOCX/SRT/VTT/JSON), 99 lingue, hosting UE, al miglior prezzo (2-20 $/mese). Canva se usi già l'ecosistema Canva per la grafica e ti va bene l'upsell verso Pro. Vidnoz per un audio singolo breve (30 min lifetime). Descript (16 $/mese) se editi video e trascrizione nella stessa app. Otter per riunioni live con cattura calendario automatica. Rev umano (1,50 $/min) solo se serve verbatim per uso legale o notarile.
Posso trascrivere audio senza registrarmi?
Per il livello gratuito di 30 minuti chiediamo la registrazione (email + password, senza carta), sia per prevenire abuso automatizzato sia per permettere di scaricare la trascrizione in più formati senza perdite. Strumenti come Transcri offrono "senza registrazione" ma limitano a file molto corti e spesso inseriscono filigrana o restringono le esportazioni. La registrazione su VexaScribe richiede 30 secondi e sblocca i cinque formati completi, il salvataggio della cronologia e la possibilità di riprendere trascrizioni parziali.
Risorse correlate
Trascrivere audio WhatsApp
Vocali WhatsApp in testo — iPhone (.m4a) e Android (.opus), con confronto onesto della trascrizione nativa WhatsApp.
Trascrizione video YouTube
Trascrivi video YouTube da URL — nessun download, esportazione TXT/SRT.
Generatore di sottotitoli IA
Crea file SRT/VTT automatici per YouTube, TikTok, Instagram Reels.
MP3 in testo
Pagina dedicata al formato MP3 — podcast, lezioni, interviste, con guida al bitrate ottimale.
Trascrivere video in testo
MP4, MOV, AVI, MKV, WebM — audio estratto automaticamente dal video.
Registratore vocale con trascrizione
Registra dal browser o carica da iPhone Voice Memos e Registratore Android.
Prezzi
Tutti i piani in dettaglio, da 2 $ a 20 $ al mese, con equivalenze in euro.
Transcribe Audio to Text (English)
The same product with English-language content and international context.
How accurate is Whisper?
Cosa sappiamo e cosa non sappiamo sulla precisione, lingua per lingua (pagina in inglese).