Stack & Architektur
Produktionsreife Komponenten — dokumentiert und austauschbar.
Unser Technology Stack ist eine konsolidierte Übersicht aller Systeme, die wir in maßgeschneiderten KI-Lösungen einsetzen. Alle Komponenten sind Open-Source oder kommerziell verfügbar, langfristig wartbar und nicht an ein einzelnes Modell oder Tool gebunden. Die vollständigen Architektur-Entscheidungen und Benchmarks finden Sie in unseren Engineering Notes.
01 · Modelle
Open-Source-LLMs, on-premise deploybar.
Wir arbeiten mit bewährten Open-Source-Modellen, die sich zu 100 % auf Kundenhardware deployen lassen. Die Modellwahl erfolgt nach Anforderung, nicht nach Marketing-Budget.
02 · Inferenz & Serving
Production-Grade Inference Engine — Batching & KV-Cache-Optimierung.
vLLM ist unser Kern-Inference-Server für L40S und H100 GPU. Ollama für einfache Setups oder lokale Entwicklung. Beide ermöglichen effizientes Batching und Persistent-Cache-Patterns.
03 · Retrieval & Vektoren
pgvector — Vektoren neben Ihren Geschäftsdaten.
Nicht: separate Vektor-DB (Pinecone, Weaviate). Sondern: pgvector in PostgreSQL mit HNSW-Index. Ein Datenbank-System, ein Backup-Regime, keine Synchronisations-Komplexität.
04 · App-Integration & Agenten
KI sitzt im Code, nicht daneben.
Der KI-Agent ist eine Django-App oder Django-Plugin. Tool-Calling über native Anthropic/OpenAI APIs, Audit-Logs für jeden Agent-Call in die Datenbank.
05 · Qualitäts-Metriken
6-Metriken-Evaluation — vor jedem Deployment.
Unser internes Eval-Harness läuft bei jedem Modell- oder Index-Wechsel. Drei Ground-Truth-Sets (Realität, Adversarial, Regression), automatisierte Reports, Regression-Blocking (>5 % blockt den Merge).
06 · Compliance & Datenschutz
Regulierte Branchen. Keine Hintertüren.
Alle Komponenten können vollständig on-premise laufen. DSGVO-Compliance durch Architektur (nicht durch Papier), EU-AI-Act-Klassifizierung für jeden Use-Case.
Stack-Übersicht
Alle Komponenten zusammen.
Dieser Stack ist bewährt in mehreren Kundenprojekten im Produktivbetrieb. Langfristig wartbar, dokumentiert und an keine einzelne Anwendung gebunden.
| Layer | Komponente | Rationale |
|---|---|---|
| Modelle | Llama 3.1, Mistral, DeepSeek | Open Weights, on-premise deploybar, quantisierbar, austauschbar |
| Inferenz | vLLM (Prod) oder Ollama (PoC) | vLLM: Batching, KV-Cache, Prefix-Caching; Ollama: einfach & schnell |
| Retrieval | pgvector in PostgreSQL + HNSW | Vektoren neben Geschäftsdaten, ein Backup-System, tenant-scoped filtering |
| App-Layer | Django 5.x + Tool-Calling | KI sitzt im Code, direkter ORM-Zugriff, Audit-Logs pro Call |
| Evaluation | 6-Metriken-Harness | recall@5, MRR, hit-rate@1, faithfulness, answer-relevance, refusal-rate — vor jedem Deployment |
| Compliance | On-Premise, DSGVO, EU AI Act | Datensouveränität durch Design, Risikoklassifizierung pro Use-Case |
Architektur-Philosophie
Warum dieser Stack.
Bewährte Komponenten statt Trend-Tools. Operationale Einfachheit statt Komplexität. Weniger Moving Parts, weniger zu debuggen, weniger zu warten.
Tiefere Einsichten
Engineering Notes — Benchmarks & Entscheidungen.
Diese Seite ist eine Übersicht. Wer die Details braucht — konkrete Latenz-Zahlen, Index-Tuning, Eval-Methodik — findet sie in unseren Engineering Notes.
Technologie & Stack · dokumentiert · on-premise-fähig
Schauen wir uns gemeinsam an, wie dieser Stack zu Ihrem Projekt passt.
30 Minuten Gespräch. Wir analysieren Ihre Anforderungen und sagen ehrlich, welche Komponenten für Sie sinnvoll sind — und welche zu kompliziert. Kein Upsell, kein Hype, nur Engineering-Realität.