Transkribering och AI

Autorec transkriberar inspelningar lokalt med whisper.cpp och kan dessutom skapa AI-sammanfattningar via valfritt OpenAI-kompatibelt API.

Så fungerar transkriberingen

  1. När en inspelning är klar extraherar autorec ljudspåret. Det sker av sig självt om Transkribera inspelningar automatiskt är på (det är av som standard). Annars startar du transkriberingen från dialogrutan efter inspelningen eller från biblioteket.
  2. Ljudet bearbetas av den valda Whisper-modellen helt och hållet på din dator
  3. Två filer skapas bredvid videon:
    • .txt – transkriptionen som ren text
    • .srt – undertextfil med tidsstämplar (kan stängas av i Inställningar)

Inget ljud och ingen video lämnar datorn under transkriberingen. Den körs på GPU:n när det finns en (Vulkan på Linux och Windows, Metal på macOS) och annars på processorn. Med Tvinga CPU i Inställningar hoppar du över GPU:n.

Språk

Autorec transkriberar möten på svenska och 16 andra språk: engelska, tyska, spanska, franska, italienska, portugisiska, nederländska, polska, turkiska, ryska, ukrainska, arabiska, hindi, kinesiska, japanska och koreanska. Autorec känner igen det talade språket under de första sekunderna av ljudet, så de flesta samtal kräver ingen inställning. Om dina samtal alltid hålls på samma språk kan du välja det under Inställningar > Transkribering > Talat språk. Ett fast språk förhindrar felgissningar när ljudet är kort eller brusigt, eller när ett samtal börjar med några ord på ett annat språk.

Alla fem modeller förstår samtliga dessa språk. För allt utom engelska är medium eller large märkbart träffsäkrare än de mindre storlekarna.

Whisper-modeller

Modellerna laddas inte ner automatiskt. Du väljer en och laddar ner den i Inställningar. De sparas i ~/.local/share/autorec/models/ (Linux och macOS) eller %LOCALAPPDATA%\autorec\models\ (Windows).

ModellStorlekHastighetTräffsäkerhetPassar bäst för
tiny~75 MBSnabbastGrundläggandeSnabba anteckningar, datorer med svag prestanda
base~142 MBSnabbBraStandard – rekommenderas för de flesta
small~466 MBMåttligBättreNär träffsäkerhet är viktigare än hastighet
medium~1,5 GBLångsamHögAndra språk än engelska, svårt ljud
large~3 GBLångsammastBästHögsta möjliga träffsäkerhet, kraftfull hårdvara

Ladda ner modeller

  1. Öppna Inställningar, kugghjulsikonen i autorec-fönstret
  2. Gå till avsnittet Transkribering
  3. Välj en modellstorlek
  4. Klicka på Ladda ner – modellen laddas ner en gång och används sedan för alla framtida transkriberingar

AI-sammanfattningar

AI-sammanfattningar använder ett moln-API för att skapa en titel och en sammanfattning utifrån transkriptionens text. Bara texten skickas – inget ljud och ingen video.

Konfiguration

  1. Öppna Inställningar > AI-sammanfattning
  2. Välj en Leverantör, som fyller i bas-URL:en och föreslår modeller, eller välj Custom och ange Bas-URL för API (t.ex. https://api.openai.com/v1)
  3. Ange din API-nyckel
  4. Välj en Modell (standard är gpt-4o-mini)
  5. Slå på Sammanfatta automatiskt efter transkribering

Prompt för sammanfattning går att redigera, så du kan be om beslut, att göra-punkter eller deadlines i stället för en allmän sammanfattning.

Kompatibla tjänster

Alla tjänster med en OpenAI-kompatibel endpoint för chat completions fungerar:

  • OpenAIhttps://api.openai.com/v1
  • OpenRouterhttps://openrouter.ai/api/v1
  • Lokala modeller (Ollama, LM Studio med flera) – använd din lokala endpoint

Vad som skapas

För varje transkriberad inspelning skapar autorec:

  • Titel – en kort, beskrivande titel för mötet
  • Sammanfattning – en koncis sammanfattning av de viktigaste punkterna som togs upp

Båda visas i videobiblioteket och i videons detaljvy, så att du lätt hittar rätt möte utan att behöva titta igenom det igen.