Lokale Modelle
Mit einem lokalen Inferenz-Server verlassen klinische Daten die eigene Infrastruktur nicht — zusammen mit Self-Hosting der MDScribe-Instanz ist das die Variante mit der größten Eigenkontrolle. Alle hier beschriebenen Server implementieren die OpenAI-Chat-Completions-API und werden in MDScribe über das ProtokollOpenAI-kompatibel angebunden.
Das Grundmuster ist immer gleich:
- Inferenz-Server starten und ein Modell laden.
- In MDScribe unter
Admin → Einstellungen → Modelle → Verbindungeneinen neuen Provider anlegen:- Protokoll:
OpenAI-kompatibel - Base URL: erforderlich, inklusive
/v1(siehe unten je Server) - API-Key: nur falls der Server einen verlangt
- Protokoll:
- Verbindung prüfen und speichern — die Modellliste wird über
GET /v1/modelssynchronisiert. - Synchronisierte Modelle den Standard-Slots zuweisen (siehe KI-Provider).
Ollama
Ollama ist der einfachste Einstieg: ein Befehl zum Installieren, ein Befehl zum Laden eines Modells.- Base URL:
http://localhost:11434/v1 - API-Key: leer lassen
- Alle per
ollama pullgeladenen Modelle erscheinen bei der Synchronisierung automatisch. - Für den produktiven Einsatz die Kontextlänge des Modells prüfen (
OLLAMA_CONTEXT_LENGTHbzw. Modellparameternum_ctx) — die Voreinstellung ist für lange Arztbriefe oft zu klein.
vLLM
vLLM ist auf Durchsatz optimiert und die richtige Wahl für dedizierte GPU-Server, die mehrere Nutzer gleichzeitig bedienen.- Base URL:
http://<server>:8000/v1 - API-Key: nur nötig, wenn der Server mit
--api-keygestartet wurde - vLLM bedient pro Prozess genau ein Modell; für getrennte Text- und Speech-to-Text-Modelle laufen mehrere Instanzen auf unterschiedlichen Ports, die in MDScribe als separate Verbindungen angelegt werden.
llama.cpp
llama.cpp (llama-server) läuft ohne GPU-Zwang auf nahezu jeder Hardware und eignet sich für kleine Installationen und Tests.
- Base URL:
http://localhost:8080/v1 - API-Key: nur nötig, wenn der Server mit
--api-keygestartet wurde - Die Kontextgröße (
-c) großzügig wählen; quantisierte GGUF-Modelle sparen Speicher bei moderatem Qualitätsverlust.
Diktat und Dokumente lokal
- Speech-to-Text: MDScribe spricht bei OpenAI-kompatiblen Providern den
/v1/audio/transcriptions-Endpoint an. Ein lokaler Whisper-Server mit dieser Schnittstelle (z. B. Speaches oder vLLM mit einem Whisper-Modell) kann den Speech-to-Text-Slot belegen. - Dokumente/Bilder: Vision-fähige offene Modelle (z. B. Qwen-VL-Varianten) können als Dokumenten-Modell dienen; alternativ übernimmt das Standard-Modell die Dokumente direkt, wenn seine Dokumente-Fähigkeit angehakt ist.