KI-Systeme bereits in Produktion

Maßgeschneiderte KI-Systeme
für regulierte Unternehmen.

KI-Engineering für Mittelstand, Kanzleien, Praxen und Industrie. On-Premise LLM (Llama, Mistral) auf eigener Hardware, RAG mit Datensouveränität, Agenten direkt in Ihre Anwendungen integriert. Kein reiner API-Wrapper, keine Cloud-Zwänge.

DSGVO + On-Premise möglich In Django integriert Aus Regensburg, seit 2010
On-Premise LLM-Server in einem Kunden-Rechenzentrum
Live · vLLM-Inferenz
llama-3.1-70b · L40S×2
P95 TTFT 782 ms · on-premise
On-Premise · Kunden-Hardware 001 / 003
24/7
Multi-Tenant-Plattformen im Dauerbetrieb
99.9%
Uptime · 30 Tage rolling
< 800ms
LLM P95 · on-premise
15+
Jahre Engineering · seit 2010

Unser KI-Stack

Open-Source-LLMs, in Django integriert, auf Ihrer Hardware.

Wir setzen auf produktionsreife, offene Komponenten. Modelle und Tools austauschbar, kein Vendor-Lock-in, keine versteckten Cloud-Abhängigkeiten.

Modelle Llama 3.1 · Mistral · DeepSeek Open-Source-LLMs, quantisierbar (Q4/Q8) für sparsamen Hardware-Footprint. Kommerzielle APIs wo sinnvoll — nie für personenbezogene Daten.
Inferenz vLLM · Ollama Production-grade Serving auf eigener GPU (RTX 4090, L40S oder größer). Batched Inference, dynamische Quantisierung, persistente Sessions.
Retrieval (RAG) pgvector · Postgres Vektor-Suche direkt neben Ihren Geschäftsdaten — keine separate Vektordatenbank, keine zusätzliche Datenkopie.
Stimme & Bild Whisper · XTTS · Vision-LLM Sprach-Transkription (DE/IT/EN), natürliche TTS und Vision-Modelle für Belege, Pläne, Fotos — alles on-premise möglich.
Orchestrierung Django · Tool-Calling Agenten leben in Ihrer Django-App mit direktem ORM-Zugriff. Tool-Calls über geprüfte Whitelists, Audit-Log inklusive.
Compliance DSGVO · EU AI Act Risikoklassifizierung, technisch-organisatorische Maßnahmen, Auftragsverarbeitung und Transparenz-Dokumentation — von Anfang an.
KI-Engineering im Detail →

Live in Produktion

Zwei KI-Systeme, die täglich laufen — nicht im Pitch, im Betrieb.

Kein Demo, kein Pilot: zwei produktive On-Premise-Systeme bei realen Kunden, mit gemessenen Ergebnissen — Llama auf eigener GPU, keine Daten in der Cloud.

Gesundheit · On-Premise

KI-Sekretariat für Hörgeräte-Kliniken

Ein Sprach-Agent (Llama 3.1 70B + Whisper, lokal auf 2× L40S) nimmt Routine-Anrufe entgegen, erkennt Patienten, prüft Termin-Verfügbarkeit live und eskaliert komplexe Fälle ans Team.

−60%
Anruf-Backlog
24/7
erreichbar
0
Patientendaten in der Cloud
Case Study lesen →
Industrie · On-Premise

On-Premise IT-Monitoring mit Llama

Llama 3.1 70B auf 2× NVIDIA L40S analysiert 1,2 Mio Logzeilen pro Tag aus 14 Systemen, triagiert Incidents, korreliert über pgvector und schreibt Auto-Tickets in Zammad.

−74%
Mean-Time-to-Detect
−68%
Nacht-Pager
0 €
Cloud-Kosten
Case Study lesen →
Alle Projekte & Referenzen →

Engagement Models

Vier Wege, mit uns zu arbeiten.

Vom KI-Strategie-Audit bis zum vollständig betriebenen On-Premise-Cluster. Jeder Schritt mit Festpreis nach Strategiegespräch, ohne Stundenfalle.

01

KI-Strategie & Audit

Workflow-Analyse, Use-Case-Bewertung, Architektur-Empfehlung. Inklusive EU-AI-Act-Klassifizierung Ihrer bestehenden Systeme und einer schriftlichen Roadmap.

Festpreis · auf Anfrage

02

Pilot-Implementierung

Ein produktionsfähiger KI-Agent oder RAG-Prototyp, eingebettet in Ihre Django-Anwendung. Wöchentliche Demos, iterativ bis zum Go-Live.

Festpreis · auf Anfrage

03

Production Rollout

Vollständiges On-Premise-Setup mit eigener Hardware, vLLM/Ollama-Stack, Monitoring, DSGVO-Dokumentation und Wartungsvertrag von Tag eins.

Festpreis · auf Anfrage

04

Managed AI

Laufender Betrieb Ihrer KI-Systeme: Modell-Updates, GPU-Wartung, vLLM-Tuning, Compliance-Reviews und 24/7-Bereitschaft auf Wunsch.

Monatlich · auf Anfrage
Kostenloses Erstgespräch →

Stimme aus dem Projekt

„Anfangs dachte ich, das wird ein Spielzeug. Nach drei Monaten merkte ich: ich spare mir täglich zwei Stunden Stress am Telefon. Und die Patient*innen merken nicht einmal, dass es kein Mensch ist — bis ich es ihnen sage.“

Empfangs-Mitarbeiterin · Hörgeräte-Klinik (anonymisiert, Referenz unter NDA)

FAQ

Die häufigsten Fragen vor dem Anruf.

Wir liefern produktive Software, keine Folien. Zwei KI-Systeme laufen seit Monaten im echten Betrieb (−60% Anruf-Backlog, −74% MTTD). Statt monatlicher Cloud-API-Gebühren betreiben wir Modelle auf Ihrer eigenen Hardware — ein Team, das baut und betreibt, kein Berater, der eine Präsentation hinterlässt.

Genau dafür sind wir da. Wir analysieren Ihren Workflow, bauen, deployen und warten das System — inklusive Modell-Updates und laufendem Betrieb. Sie brauchen keine KI-Expertise im Haus: Sie bekommen Dokumentation, einen klaren Wartungsweg und einen direkten Ansprechpartner, kein Callcenter.

Nach dem Strategie-Audit liefert ein Pilot in 8–12 Wochen einen produktionsreifen Use-Case — mit wöchentlichen Demos. Kein Big-Bang nach einem Jahr: Sie sehen früh, ob es trägt, und entscheiden nach jedem 2-Wochen-Sprint, ob wir weitermachen.

Dann sagen wir es Ihnen — im Strategie-Audit, bevor Sie groß investieren. Wir bewerten ehrlich, ob ein Use-Case echten ROI bringt. Lieber ein klares „hier lohnt es sich nicht“ als ein teures Projekt ohne Wirkung. Den Audit-Festpreis rechnen wir auf einen folgenden Pilot an.

Lassen Sie uns Ihre KI-Lösung skizzieren.

30 Minuten am Telefon. Wir analysieren Ihren Workflow und sagen ehrlich, ob KI für Sie ROI bringt — und wenn ja, mit welcher Architektur (Agent, RAG, on-premise oder Cloud). Kein KI-Hype, kein Verkaufspitch.

+49 941 20 90 28 62 [email protected]

Antwort in 24 h · Mo–Fr 9–18 Uhr · CODLAB · St.-Jakob-Str. 6, 93161 Sinzing
Festpreis in 48 h DSGVO + Server in Deutschland Direkter Entwickler · kein Callcenter