Engineering notes
Notizen vom Engineering-Tisch.
Real architecture decisions, benchmarks from production deployments, patterns we reuse across customer projects. No generic tutorials, no marketing whitepapers — only the questions we had to answer on running systems.
How we evaluate a RAG system before it goes live
Our internal eval harness runs on every model or index swap: 7 metrics (recall@k, MRR, faithfulness, latency P95, …), three ground-truth sets from real customer questions, automated regression report. What we measure, how we build the sets, and why “works in the demo” isn't enough for regulated industries.
Llama 3.1 70B on a single L40S — what we measured
Quantisierung (Q4 vs Q8 vs FP16), Batched Inference unter vLLM, KV-Cache-Tuning, dynamische Sequenz-Längen. Wo der Latency-Knick liegt, wann eine zweite GPU lohnt, und welche Prompt-Größen den Throughput halbieren. Reale Zahlen aus einem produktiven Customer-Support-Agenten.
pgvector next to the Django ORM — pattern and benchmark
Warum wir Vektor-Suche direkt in Postgres legen, statt eine separate Pinecone- oder Weaviate-Instanz zu betreiben. Indexing-Strategie (HNSW vs IVFFlat), Tuning-Parameter für unseren Workload, Recall-Vergleich. Mit dem ORM-Mixin, den wir in jedem Projekt wiederverwenden, und einem ehrlichen Blick auf die Grenzen.