Stack & Architektur

Produktionsreife Komponenten — dokumentiert und austauschbar.

Unser Technology Stack ist eine konsolidierte Übersicht aller Systeme, die wir in maßgeschneiderten KI-Lösungen einsetzen. Alle Komponenten sind Open-Source oder kommerziell verfügbar, langfristig wartbar und nicht an ein einzelnes Modell oder Tool gebunden. Die vollständigen Architektur-Entscheidungen und Benchmarks finden Sie in unseren Engineering Notes.

01 · Modelle

Open-Source-LLMs, on-premise deploybar.

Wir arbeiten mit bewährten Open-Source-Modellen, die sich zu 100 % auf Kundenhardware deployen lassen. Die Modellwahl erfolgt nach Anforderung, nicht nach Marketing-Budget.

Large Language Model Llama 3.1 Meta-Modell in drei Größen: 8B für Latenz, 70B für Intelligenz. Quantisiert in Q4_K_M oder Q8. Open Weights, keine Einschränkungen. Open Weights · 8B bis 70B · Multi-Sprache
Large Language Model Mistral · DeepSeek Mistral 7B für Speed, Mistral Large 2 für längere Kontexte. DeepSeek-V3 für sehr spezifische Aufgaben. Alle auf Kundenhardware deployment-fähig. Mistral 7B/Large · DeepSeek-V3 · Effizient
Warum dieser Modell-Mix: Llama dominiert in Qualität und Community-Support, Mistral 7B in Durchsatz, DeepSeek für Domain-Spezifisches. Wir wählen nach Eval-Set-Ergebnis und Latenz-Anforderung — kein Vendor-Lock-in, Modelle bleiben austauschbar.

02 · Inferenz & Serving

Production-Grade Inference Engine — Batching & KV-Cache-Optimierung.

vLLM ist unser Kern-Inference-Server für L40S und H100 GPU. Ollama für einfache Setups oder lokale Entwicklung. Beide ermöglichen effizientes Batching und Persistent-Cache-Patterns.

Inferenz-Server vLLM High-Performance-Server mit Prefix-Caching, dynamischem KV-Cache, Batched Inference. Llama 3.1 70B in Q4_K_M auf L40S: Time-to-First-Token P50 ~480 ms, P95 ~780 ms (batch_size=1). Prefix Caching · HNSW-Support · Batched · NVIDIA-native
Alternative / Local Ollama Vereinfachte Locally-Run Alternative für Entwicklung oder Proof-of-Concept. Unkompliziert für Demo-Zwecke, aber weniger Tuning-Optionen als vLLM. Einfach · Cross-Platform · PoC-freundlich
Warum vLLM produktiv: Nativ auf NVIDIA GPUs optimiert, Caching-Features reduzieren Latenz um 30–50 %, Batching ermöglicht höheren Durchsatz. Ollama genügt für Piloten, aber vLLM ist der Standard für SLA-Workloads.

03 · Retrieval & Vektoren

pgvector — Vektoren neben Ihren Geschäftsdaten.

Nicht: separate Vektor-DB (Pinecone, Weaviate). Sondern: pgvector in PostgreSQL mit HNSW-Index. Ein Datenbank-System, ein Backup-Regime, keine Synchronisations-Komplexität.

Vektor-Suche pgvector + HNSW PostgreSQL 16+ mit pgvector Extension. HNSW-Index für schnelle Nearest-Neighbor-Suche, IVFFlat für größere Korpora. Recall@5 > 95 % auf echten Kundendaten. HNSW · IVFFlat · PostgreSQL 16 · Sub-100ms
Fallback (nur >50M embeddings) Qdrant · Pinecone Separate Vektor-DB nur wenn Corpus >50M Embeddings oder Strict P50 <50ms Latenz. Für 99 % der Mittelstands-Use-Cases overkill. Enterprise · Optional · Specialist
Warum pgvector Standard: Operationale Einfachheit (ein DB-Backup, ein Monitoring-System), tenant-scoped Filtering via SQL, direkt neben Geschäftsdaten. Benchmark zeigt: für 500k–2M Embeddings schneller und günstiger als externe Speicher.

04 · App-Integration & Agenten

KI sitzt im Code, nicht daneben.

Der KI-Agent ist eine Django-App oder Django-Plugin. Tool-Calling über native Anthropic/OpenAI APIs, Audit-Logs für jeden Agent-Call in die Datenbank.

Web-Framework Django 5.x Alle KI-Agenten sind Django-Apps oder Plugins. Direkter Zugriff auf ORM-Modelle (Patient, Termin, Rechnung), Permissions, Authentication. Deployment via Standard-Django-Prozess. Django 5.0+ · ORM-native · Batteries-included
Agent-Pattern Tool-Calling + Audit Agenten über Claude/OpenAI/Llama Tool-Use. Jeder Call wird mit User, Timestamp, Input, Output in Datenbank geloggt. Refusal-Logik und Fallback-Behavior definiert pro Agent. Tool-Use · Reflexion · Deterministic Fallback
Warum in Django embedded: Keine Zapier-Workflows, keine externe API-Synchronisation. Agenten haben direkten Zugriff auf Ihre ORM-Modelle, Permissions und Geschäftslogik. Ein Codebase, ein Deployment, ein Permissions-Audit-Trail.

05 · Qualitäts-Metriken

6-Metriken-Evaluation — vor jedem Deployment.

Unser internes Eval-Harness läuft bei jedem Modell- oder Index-Wechsel. Drei Ground-Truth-Sets (Realität, Adversarial, Regression), automatisierte Reports, Regression-Blocking (>5 % blockt den Merge).

Die 6 Metriken:
Retrieval
recall@5
Ranking
MRR
Hit-Rate
@1
Generation
faithfulness
Relevanz
answer-relevance
Safety
refusal-rate
Evaluation-Prozess: Drei Sets pro Projekt (Realität: echte User-Fragen, Adversarial: Edge-Cases und Halluzinationen, Regression: alte Queries um 6–12 Monate). Bei jedem Modell- oder Index-Wechsel: Automatisierter Regression-Report. Regression >5 % blockt.
Evaluation im Detail — Engineering Note 01 →

06 · Compliance & Datenschutz

Regulierte Branchen. Keine Hintertüren.

Alle Komponenten können vollständig on-premise laufen. DSGVO-Compliance durch Architektur (nicht durch Papier), EU-AI-Act-Klassifizierung für jeden Use-Case.

Datensouveränität On-Premise LLM, Embedding-Engine und Vektor-DB laufen auf Kundenhardware in eigenem Netzwerk. Keine Datenübertragung an Dritte, DSGVO-konform durch Design. Für Behörden, Kanzleien, Praxen, Industrie. Vollständig dezentralisiert · Keine Cloud · Kein Datentransfer
Regulierung EU AI Act · DSGVO Risikoklassifizierung (minimal · limited · high risk), Pflicht-Dokumentation und Bias-Audit. Pragmatischer Ansatz für Mittelstand — keine 200-seitigen Kanzlei-Gutachten, nur was rechtlich erforderlich ist. Risk-Klassifizierung · Transparenz-Dokumentation · Audit-Trail
Warum on-premise Architektur: Regulierte Branchen (Arztpraxen, Kanzleien, Behörden) haben null Toleranz für externe API-Abhängigkeit. On-Premise mit lokal gehosteten Modellen ist die einzige akzeptable Topologie. Die Hardware-Kosten sind überschaubar — eine L40S-GPU liegt bei ≈ 9.000 €, ein kompletter On-Premise-Inferenz-Server (2× L40S) bei ≈ 28.000 €, der Einstieg mit einer RTX 4090 ab ≈ 2.500 € — sodass auch KMU es sich leisten können.
DSGVO-konform per Architektur
EU-AI-Act-Risikoklassifizierung
On-Premise deployt · kein Vendor-Lock-in

Stack-Übersicht

Alle Komponenten zusammen.

Dieser Stack ist bewährt in mehreren Kundenprojekten im Produktivbetrieb. Langfristig wartbar, dokumentiert und an keine einzelne Anwendung gebunden.

Layer Komponente Rationale
Modelle Llama 3.1, Mistral, DeepSeek Open Weights, on-premise deploybar, quantisierbar, austauschbar
Inferenz vLLM (Prod) oder Ollama (PoC) vLLM: Batching, KV-Cache, Prefix-Caching; Ollama: einfach & schnell
Retrieval pgvector in PostgreSQL + HNSW Vektoren neben Geschäftsdaten, ein Backup-System, tenant-scoped filtering
App-Layer Django 5.x + Tool-Calling KI sitzt im Code, direkter ORM-Zugriff, Audit-Logs pro Call
Evaluation 6-Metriken-Harness recall@5, MRR, hit-rate@1, faithfulness, answer-relevance, refusal-rate — vor jedem Deployment
Compliance On-Premise, DSGVO, EU AI Act Datensouveränität durch Design, Risikoklassifizierung pro Use-Case

Architektur-Philosophie

Warum dieser Stack.

Bewährte Komponenten statt Trend-Tools. Operationale Einfachheit statt Komplexität. Weniger Moving Parts, weniger zu debuggen, weniger zu warten.

01 Reale Benchmarks, keine Schätzungen Alle Komponenten sind in mehreren Kundenprojekten im Einsatz. vLLM-Latenz, pgvector-Recall, Eval-Metrik-Kalibrierung — das alles ist gemessen auf echten Workloads, nicht theoretisch.
02 Operationale Einfachheit Ein Datenbank-System (PostgreSQL), keine separate Vektor-DB. Ein Deployment-Prozess (Django), keine externen API-Abhängigkeiten für das Kern-Setup. Weniger zu sichern, weniger zu überwachen.
03 Langfristig wartbar Alle Komponenten sind Open-Source oder etablierte kommerzielle Services, aktiv gepflegt und ohne esoterische Abhängigkeiten. In 3 Jahren noch deployt, ohne vendor zu fragen.
04 Keine Hintertüren On-Premise ist optional, aber standardmäßig möglich. Alle Komponenten können auf eigener Hardware laufen. Keine erzwungene Cloud-Abhängigkeit für Data-Residency oder Compliance.
Architektur-Entscheidungen im Detail — Engineering Notes →

Tiefere Einsichten

Engineering Notes — Benchmarks & Entscheidungen.

Diese Seite ist eine Übersicht. Wer die Details braucht — konkrete Latenz-Zahlen, Index-Tuning, Eval-Methodik — findet sie in unseren Engineering Notes.

Note 01 RAG-Evaluation Eval-Harness, Ground-Truth-Konstruktion, Regression-Blocking, Kalibrierung für konsistente Messungen über Modellwechsel hinweg. Zur Note →
Note 02 Llama 3.1 auf L40S Quantisierung, vLLM-Batching, KV-Cache-Tuning, Latency-Profile (P50/P95), wo der Knick liegt und wann eine zweite GPU lohnt. Zur Note →
Note 03 pgvector & Django ORM Warum pgvector statt Pinecone, Index-Strategie, Tuning-Parameter, Recall-Vergleich, Grenzen des Ansatzes und wann eine externe Vektor-DB nötig ist. Zur Note →

Technologie & Stack · dokumentiert · on-premise-fähig

Schauen wir uns gemeinsam an, wie dieser Stack zu Ihrem Projekt passt.

30 Minuten Gespräch. Wir analysieren Ihre Anforderungen und sagen ehrlich, welche Komponenten für Sie sinnvoll sind — und welche zu kompliziert. Kein Upsell, kein Hype, nur Engineering-Realität.

+49 941 20 90 28 62 WhatsApp

Antwort in 24 h · Mo–Fr 9–18 Uhr · CODLAB · St.-Jakob-Str. 6, 93161 Sinzing

Erfahrung seit 2010 DSGVO + Server in Deutschland Direkter Entwickler · kein Callcenter