KI-Sekretariat für Hörgeräte-Kliniken
Ein Sprach-Agent (Llama 3.1 70B + Whisper, lokal auf 2× L40S) nimmt Routine-Anrufe entgegen, erkennt Patienten, prüft Termin-Verfügbarkeit live und eskaliert komplexe Fälle ans Team.
KI-Engineering für Mittelstand, Kanzleien, Praxen und Industrie. On-Premise LLM (Llama, Mistral) auf eigener Hardware, RAG mit Datensouveränität, Agenten direkt in Ihre Anwendungen integriert. Kein reiner API-Wrapper, keine Cloud-Zwänge.
Engineering Notes
Dokumentierte Architektur-Entscheidungen, Benchmarks aus Produktions-Deployments und Engineering-Pattern, die wir wiederverwenden. Keine generischen Tutorials, keine Marketing-Whitepaper — nur die Fragen, die wir bei realen Kundenprojekten beantworten mussten.
Unser internes Eval-Harness: 7 Metriken, drei Ground-Truth-Sets aus echten Kundenfragen, automatisierte Regression bei jedem Modell-Wechsel. Was wir messen — und warum „funktioniert in der Demo” nicht reicht.
Lesen → Note 02 · InferenceQuantisierung (Q4/Q8), Batched Inference, vLLM-Konfiguration. Wo der Latency-Knick liegt, wann eine zweite GPU lohnt und welche Token-Größen den Throughput halbieren. Reale Zahlen aus einem Produktions-Deployment.
Lesen → Note 03 · ArchitekturWarum wir Vektor-Suche direkt in Postgres legen statt eine separate Pinecone- oder Weaviate-Instanz zu betreiben. Indexing-Strategie, HNSW-Tuning, Recall-Vergleich. Mit dem ORM-Mixin, den wir in jedem Projekt wiederverwenden.
Lesen →Unser KI-Stack
Wir setzen auf produktionsreife, offene Komponenten. Modelle und Tools austauschbar, kein Vendor-Lock-in, keine versteckten Cloud-Abhängigkeiten.
Live in Produktion
Kein Demo, kein Pilot: zwei produktive On-Premise-Systeme bei realen Kunden, mit gemessenen Ergebnissen — Llama auf eigener GPU, keine Daten in der Cloud.
Ein Sprach-Agent (Llama 3.1 70B + Whisper, lokal auf 2× L40S) nimmt Routine-Anrufe entgegen, erkennt Patienten, prüft Termin-Verfügbarkeit live und eskaliert komplexe Fälle ans Team.
Llama 3.1 70B auf 2× NVIDIA L40S analysiert 1,2 Mio Logzeilen pro Tag aus 14 Systemen, triagiert Incidents, korreliert über pgvector und schreibt Auto-Tickets in Zammad.
Engagement Models
Vom KI-Strategie-Audit bis zum vollständig betriebenen On-Premise-Cluster. Jeder Schritt mit Festpreis nach Strategiegespräch, ohne Stundenfalle.
01
Workflow-Analyse, Use-Case-Bewertung, Architektur-Empfehlung. Inklusive EU-AI-Act-Klassifizierung Ihrer bestehenden Systeme und einer schriftlichen Roadmap.
02
Ein produktionsfähiger KI-Agent oder RAG-Prototyp, eingebettet in Ihre Django-Anwendung. Wöchentliche Demos, iterativ bis zum Go-Live.
03
Vollständiges On-Premise-Setup mit eigener Hardware, vLLM/Ollama-Stack, Monitoring, DSGVO-Dokumentation und Wartungsvertrag von Tag eins.
04
Laufender Betrieb Ihrer KI-Systeme: Modell-Updates, GPU-Wartung, vLLM-Tuning, Compliance-Reviews und 24/7-Bereitschaft auf Wunsch.
Stimme aus dem Projekt
„Anfangs dachte ich, das wird ein Spielzeug. Nach drei Monaten merkte ich: ich spare mir täglich zwei Stunden Stress am Telefon. Und die Patient*innen merken nicht einmal, dass es kein Mensch ist — bis ich es ihnen sage.“
Empfangs-Mitarbeiterin · Hörgeräte-Klinik (anonymisiert, Referenz unter NDA)
FAQ
Wir liefern produktive Software, keine Folien. Zwei KI-Systeme laufen seit Monaten im echten Betrieb (−60% Anruf-Backlog, −74% MTTD). Statt monatlicher Cloud-API-Gebühren betreiben wir Modelle auf Ihrer eigenen Hardware — ein Team, das baut und betreibt, kein Berater, der eine Präsentation hinterlässt.
Genau dafür sind wir da. Wir analysieren Ihren Workflow, bauen, deployen und warten das System — inklusive Modell-Updates und laufendem Betrieb. Sie brauchen keine KI-Expertise im Haus: Sie bekommen Dokumentation, einen klaren Wartungsweg und einen direkten Ansprechpartner, kein Callcenter.
Nach dem Strategie-Audit liefert ein Pilot in 8–12 Wochen einen produktionsreifen Use-Case — mit wöchentlichen Demos. Kein Big-Bang nach einem Jahr: Sie sehen früh, ob es trägt, und entscheiden nach jedem 2-Wochen-Sprint, ob wir weitermachen.
Dann sagen wir es Ihnen — im Strategie-Audit, bevor Sie groß investieren. Wir bewerten ehrlich, ob ein Use-Case echten ROI bringt. Lieber ein klares „hier lohnt es sich nicht“ als ein teures Projekt ohne Wirkung. Den Audit-Festpreis rechnen wir auf einen folgenden Pilot an.
30 Minuten am Telefon. Wir analysieren Ihren Workflow und sagen ehrlich, ob KI für Sie ROI bringt — und wenn ja, mit welcher Architektur (Agent, RAG, on-premise oder Cloud). Kein KI-Hype, kein Verkaufspitch.
+49 941 20 90 28 62 [email protected]