Transkribera Ljudfil — AI-transkribering på 50+ språk
Ladda upp en ljudfil eller spela in direkt i webbläsaren och få texten på några minuter — med talare, tidsstämplar och 95 %+ träffsäkerhet.
- Inget kort behövs
- Ingen registrering behövs
Betyg 4,9/5 från våra användare
Hundratals snabbväxande företag litar på oss
Så fungerar det
Så transkriberar du en ljudfil i tre steg
- 01

Ladda upp din ljudfil
Dra in en fil eller spela in direkt i webbläsaren. Fungerar med MP3, WAV, M4A, FLAC, MP4, MOV och över 25 andra format.
- 02

AI:n transkriberar ljudet
Taligenkänningen känner av språket, skiljer talarna åt och sätter skiljetecken och tidsstämplar. En timmes ljud är klar på några minuter.
- 03

Redigera och exportera
Rätta texten bredvid inspelningen och ladda ner som TXT, DOCX eller PDF — eller som SRT och VTT för undertexter.
Språk och format
Ljud till text på dessa språk och format
Över 50 språk med träffsäkerhet på modersmålsnivå
Engelska
Spanska
Tyska
Franska
Italienska
Rumänska
Portugisiska
Polska
Indonesiska
Malajiska
Svenska
Danska
Nederländska
Finska
Norska
RyskaKatalanska
Turkiska
Koreanska
Thailändska
Japanska
Tjeckiska
Ukrainska
Kroatiska
Grekiska
Arabiska
Bosniska
Ungerska
Bulgariska
Serbiska
MakedonskaGaliciska
Kantonesiska
Slovakiska
Hindi
Slovenska
Lettiska
Urdu
Azerbajdzjanska
Estniska
Vietnamesiska
Hebreiska
Litauiska
Ljudformat att transkribera
Videoformat att transkribera
Oberoende benchmark
Oberoende testad mot Microsoft, Google och Whisper
- ~95%
Träffsäkerhet på Antena 1-nyheter
95,6 % på Antena 1-nyhetssetet — högst av alla sju testade system, före Microsoft, Google och varje Whisper-modell.
- ~90%
Träffsäkerhet på poddar
89,8 % på poddar — återigen etta i ostrukturerade samtal, och över 12 poäng före Google på samma ljud.
- 6 of 6
Dataset före Google
Vatis transkriberade varje dataset i studien mer träffsäkert än Googles Chirp, från studionyheter till överlappande filmdialog.
| Modell | Inom domänen | Utanför distributionen | ||||
|---|---|---|---|---|---|---|
| ProTV — Tv-nyheter | Antena 1 — Tv-nyheter | Audiobooks — Uppläst skönlitterär prosa | Films — Överlappande filmdialog | Stories — Barnberättelser | Podcasts — Spontant samtal | |
| Wav2Vec 2.0 | 27.7 | 25.6 | 40.8 | 75.4 | 54.1 | 36.3 |
| Whisper Small | 31.6 | 26.8 | 40.0 | 60.0 | 41.1 | 31.9 |
| Whisper Large | 12.3 | 5.9 | 14.8 | 27.3 — bäst i kolumnen | 10.9 — bäst i kolumnen | 11.7 |
| Whisper Small + Echo | 9.4 | 10.1 | 18.8 | 54.1 | 21.0 | 21.6 |
| Microsoft Transcribe | 2.9 — bäst i kolumnen | 4.8 | 10.6 — bäst i kolumnen | 31.1 | 17.6 | 11.5 |
| Google Chirp (USM) | 12.1 | 11.3 | 20.2 | 37.6 | 22.4 | 22.4 |
| Vatis | 5.2 | 4.4 — bäst i kolumnen | 13.0 | 31.2 | 16.0 | 10.2 — bäst i kolumnen |
Siffrorna är word error rate (%) — andelen ord ett system känner igen fel, så lägre är bättre. Det är måttet studien rapporterar, behållet här så att tabellen kan kontrolleras rad för rad mot den; de framhävda siffrorna ovan är dess motsats, träffsäkerheten. Med 4,4 WER på Antena 1 känner Vatis igen 95,6 % av orden rätt. Alla värden är zero-shot: inget system anpassades till de här inspelningarna före mätningen.
Inramade värden är bäst i sin kolumn.
Vatis is a Romanian commercial ASR service known for its strong transcription accuracy in Romanian. Its models are trained on proprietary data and optimized for production use.
Funktioner
Varför transkribera ljudfil med Vatis?
- Vatis Tech v5
- Azure
- Speechmatics
- Whisper
- 95% av mänsklig nivå
95 %+ träffsäkerhet på över 50 språk
Modeller tränade per språk, inte en generisk modell — svenska har en egen. Vid normal ljudkvalitet blir över 95 % av orden rätt i transkriberingen.
Prova gratis
Talare, kapitel och sammanfattning — automatiskt
Varje replik får talarens namn och en tidsstämpel. Be om en sammanfattning, de viktigaste punkterna eller ett ordagrant citat, och hoppa till exakt rätt sekund i inspelningen.
Prova gratis
Alla format, från MP3 till MP4
Ljud i MP3, WAV, M4A, FLAC, AAC och OGG; video i MP4, MOV, MKV, AVI och WebM. Filer upp till 5 GB och 10 timmar i Pro-planen.
Prova gratis- GDPR-anpassat
- ISO 27001-certifierat
- SOC 2 Type II pågår
Säkert och GDPR-anpassat
GDPR-anpassat och ISO 27001-certifierat, med SOC 2 Type II som pågår. Dina inspelningar behandlas på europeiska servrar och du raderar dem när du vill.
Prova gratis
Flerspråkiga inspelningar
Känner av inspelningens språk automatiskt och hänger med när deltagarna i samma möte växlar mellan svenska och engelska.
Prova gratis
Undertexter och översättning med ett klick
Exportera transkriberingen som SRT eller VTT och översätt den till över 50 språk, så att samma video kan visas med svenska, engelska eller tyska undertexter.
Prova gratis

In a world full of unsearchable but crucial information living on TikTok, Instagram Reels, Facebook and YouTube lives, Vatis gave us, as journalists, the opportunity to collect, transcribe and search that information.
Without it, I would have to listen to thousands of hours of interviews, debates and streamed video with nothing but two ears, ten fingers and a headset.

För utvecklare som läser dokumentationen före marknadsföringssidan
Läs dokumentationen, prova gratis och berätta vad du tycker.
Vanliga frågor
Vanliga frågor om att transkribera ljudfil
Hittar du inte svaret? Kontakta vårt supportteam.
Hur transkriberar jag en ljudfil?
Ladda upp filen eller spela in direkt i webbläsaren, vänta några minuter och ladda ner texten. Vatis omvandlar ljud till text med skiljetecken, tidsstämplar och namn på varje talare.
Vad betyder transkribera?
Att transkribera är att skriva ner inspelat tal som text. Förr var det handarbete som tog flera timmar per inspelning; med AI-transkribering blir en timmes ljud text på några minuter, till en bråkdel av kostnaden för en transkriberare.
Vad kostar det att transkribera en ljudfil?
Pro-planen debiteras per timme ljud, med rabatt vid större volymer. De första 10 minuterna kan du prova utan registrering eller kort.
Hur träffsäker är AI-transkribering?
Vid normal ljudkvalitet över 95 % på svenska. Bakgrundsmusik, personer som pratar i munnen på varandra eller hårt komprimerat ljud drar ner resultatet, men även då är det konkurrenskraftigt.
Vilka ljudformat kan jag transkribera?
MP3, WAV, M4A, FLAC, OGG, AAC, AIFF och WMA för ljud; MP4, MOV, MKV, WebM, AVI och FLV för video. Över 25 format totalt.
Kan jag transkribera en intervju eller ett möte?
Ja. Ladda upp inspelningen från diktafonen eller mobilen. Talaridentifieringen skiljer intervjuaren från den intervjuade, och i ett möte får varje deltagare sina egna repliker.
Kan jag transkribera video också?
Ja. Ladda upp videofilen så plockar Vatis ut ljudet själv. Exportera sedan som SRT eller VTT för att texta videon.
Kan jag transkribera ljud på engelska?
Ja. Vatis känner igen över 50 språk, bland annat engelska, tyska, franska och spanska, och känner av språket automatiskt. Den färdiga texten kan du sedan översätta till svenska med ett klick.
Hur lång tid tar transkriberingen?
Betydligt kortare än inspelningen: en timmes ljud är oftast klar på några minuter. API:et stöder även transkribering i realtid (streaming) för livesändningar.
Är mina uppgifter säkra?
Ja. Vatis är GDPR-anpassat, ISO 27001-certifierat och SOC 2 Type II pågår. Inspelningarna behandlas på europeiska servrar, krypterade under överföring och lagring, och du raderar dem när du vill från ditt konto.
Hur exporterar jag texten?
Ladda ner som TXT, DOCX, PDF, SRT, VTT eller JSON. SRT och VTT är formaten för undertexter; JSON innehåller tidsstämpeln för varje ord.
Finns det ett API?
Ja. Ett REST-API med SDK:er för Python, Node.js, Go och fler, för både batchbearbetning och realtid. Varje nytt API-konto börjar med 10 € i krediter att testa med.
Hur stor får filen vara?
Upp till 5 GB och upp till 10 timmar per fil i Pro-planen.






