Note tecniche
Notizen vom Engineering-Tisch.
Decisioni architetturali reali, benchmark da deployment in produzione, pattern che riutilizziamo in più progetti cliente. Niente tutorial generici, niente whitepaper di marketing — solo le domande a cui abbiamo dovuto rispondere su sistemi attivi.
Come valutiamo un sistema RAG prima che vada in produzione
Il nostro harness interno di evaluation gira a ogni cambio di modello o indice: 7 metriche (recall@k, MRR, faithfulness, latency P95, …), tre ground-truth set da domande reali dei clienti, regression report automatico. Cosa misuriamo, come costruiamo i set e perché „funziona nella demo” non basta per i settori regolati.
Llama 3.1 70B su una L40S — cosa abbiamo misurato
Quantisierung (Q4 vs Q8 vs FP16), Batched Inference unter vLLM, KV-Cache-Tuning, dynamische Sequenz-Längen. Wo der Latency-Knick liegt, wann eine zweite GPU lohnt, und welche Prompt-Größen den Throughput halbieren. Reale Zahlen aus einem produktiven Customer-Support-Agenten.
pgvector accanto al Django ORM — pattern e benchmark
Warum wir Vektor-Suche direkt in Postgres legen, statt eine separate Pinecone- oder Weaviate-Instanz zu betreiben. Indexing-Strategie (HNSW vs IVFFlat), Tuning-Parameter für unseren Workload, Recall-Vergleich. Mit dem ORM-Mixin, den wir in jedem Projekt wiederverwenden, und einem ehrlichen Blick auf die Grenzen.