Engineering Notes
Notizen vom Engineering-Tisch.
Reale Architektur-Entscheidungen, Benchmarks aus Produktions-Deployments, Pattern, die wir in mehreren Kundenprojekten wiederverwenden. Keine generischen Tutorials, keine Marketing-Whitepaper — nur die Fragen, die wir bei laufenden Systemen beantworten mussten.
Wie wir ein RAG-System bewerten, bevor es live geht
Unser internes Eval-Harness läuft bei jedem Modell- oder Index-Wechsel: 7 Metriken (recall@k, MRR, faithfulness, latency P95, …), drei Ground-Truth-Sets aus echten Kundenfragen, automatisierter Regression-Report. Was wir messen, wie wir die Sets bauen und warum „funktioniert in der Demo” für regulierte Branchen nicht reicht.
Llama 3.1 70B auf einer L40S — was wir gemessen haben
Quantisierung (Q4 vs Q8 vs FP16), Batched Inference unter vLLM, KV-Cache-Tuning, dynamische Sequenz-Längen. Wo der Latency-Knick liegt, wann eine zweite GPU lohnt, und welche Prompt-Größen den Throughput halbieren. Reale Zahlen aus einem produktiven Customer-Support-Agenten.
pgvector neben dem Django-ORM — Pattern und Benchmark
Warum wir Vektor-Suche direkt in Postgres legen, statt eine separate Pinecone- oder Weaviate-Instanz zu betreiben. Indexing-Strategie (HNSW vs IVFFlat), Tuning-Parameter für unseren Workload, Recall-Vergleich. Mit dem ORM-Mixin, den wir in jedem Projekt wiederverwenden, und einem ehrlichen Blick auf die Grenzen.