Transkribering och AI
Autorec transkriberar inspelningar lokalt med whisper.cpp och kan dessutom skapa AI-sammanfattningar via valfritt OpenAI-kompatibelt API.
Så fungerar transkriberingen
- När en inspelning är klar extraherar autorec ljudspåret. Det sker av sig självt om Transkribera inspelningar automatiskt är på (det är av som standard). Annars startar du transkriberingen från dialogrutan efter inspelningen eller från biblioteket.
- Ljudet bearbetas av den valda Whisper-modellen helt och hållet på din dator
- Två filer skapas bredvid videon:
.txt– transkriptionen som ren text.srt– undertextfil med tidsstämplar (kan stängas av i Inställningar)
Inget ljud och ingen video lämnar datorn under transkriberingen. Den körs på GPU:n när det finns en (Vulkan på Linux och Windows, Metal på macOS) och annars på processorn. Med Tvinga CPU i Inställningar hoppar du över GPU:n.
Språk
Autorec transkriberar möten på svenska och 16 andra språk: engelska, tyska, spanska, franska, italienska, portugisiska, nederländska, polska, turkiska, ryska, ukrainska, arabiska, hindi, kinesiska, japanska och koreanska. Autorec känner igen det talade språket under de första sekunderna av ljudet, så de flesta samtal kräver ingen inställning. Om dina samtal alltid hålls på samma språk kan du välja det under Inställningar > Transkribering > Talat språk. Ett fast språk förhindrar felgissningar när ljudet är kort eller brusigt, eller när ett samtal börjar med några ord på ett annat språk.
Alla fem modeller förstår samtliga dessa språk. För allt utom engelska är medium eller large märkbart träffsäkrare än de mindre storlekarna.
Whisper-modeller
Modellerna laddas inte ner automatiskt. Du väljer en och laddar ner den i Inställningar. De sparas i ~/.local/share/autorec/models/ (Linux och macOS) eller %LOCALAPPDATA%\autorec\models\ (Windows).
| Modell | Storlek | Hastighet | Träffsäkerhet | Passar bäst för |
|---|---|---|---|---|
| tiny | ~75 MB | Snabbast | Grundläggande | Snabba anteckningar, datorer med svag prestanda |
| base | ~142 MB | Snabb | Bra | Standard – rekommenderas för de flesta |
| small | ~466 MB | Måttlig | Bättre | När träffsäkerhet är viktigare än hastighet |
| medium | ~1,5 GB | Långsam | Hög | Andra språk än engelska, svårt ljud |
| large | ~3 GB | Långsammast | Bäst | Högsta möjliga träffsäkerhet, kraftfull hårdvara |
Ladda ner modeller
- Öppna Inställningar, kugghjulsikonen i autorec-fönstret
- Gå till avsnittet Transkribering
- Välj en modellstorlek
- Klicka på Ladda ner – modellen laddas ner en gång och används sedan för alla framtida transkriberingar
AI-sammanfattningar
AI-sammanfattningar använder ett moln-API för att skapa en titel och en sammanfattning utifrån transkriptionens text. Bara texten skickas – inget ljud och ingen video.
Konfiguration
- Öppna Inställningar > AI-sammanfattning
- Välj en Leverantör, som fyller i bas-URL:en och föreslår modeller, eller välj Custom och ange Bas-URL för API (t.ex.
https://api.openai.com/v1) - Ange din API-nyckel
- Välj en Modell (standard är
gpt-4o-mini) - Slå på Sammanfatta automatiskt efter transkribering
Prompt för sammanfattning går att redigera, så du kan be om beslut, att göra-punkter eller deadlines i stället för en allmän sammanfattning.
Kompatibla tjänster
Alla tjänster med en OpenAI-kompatibel endpoint för chat completions fungerar:
- OpenAI –
https://api.openai.com/v1 - OpenRouter –
https://openrouter.ai/api/v1 - Lokala modeller (Ollama, LM Studio med flera) – använd din lokala endpoint
Vad som skapas
För varje transkriberad inspelning skapar autorec:
- Titel – en kort, beskrivande titel för mötet
- Sammanfattning – en koncis sammanfattning av de viktigaste punkterna som togs upp
Båda visas i videobiblioteket och i videons detaljvy, så att du lätt hittar rätt möte utan att behöva titta igenom det igen.