Stack & Architettura

Componenti pronte per la produzione — documentati e intercambiabili.

Il nostro stack tecnologico è una panoramica consolidata di tutti i sistemi che distribuiamo nelle soluzioni AI personalizzate. Tutti i componenti sono open-source o disponibili in commercio, mantenibili a lungo termine e non vincolati a un singolo modello o strumento. Le decisioni architetturali complete e i benchmark sono disponibili nelle nostre Engineering Notes.

01 · Modelli

LLM open-source, deployabili on-premise.

Wir arbeiten mit bewährten Open-Source-Modellen, die sich zu 100 % auf Kundenhardware deployen lassen. Die Modellwahl erfolgt nach Anforderung, nicht nach Marketing-Budget.

Large Language Model Llama 3.1 Modello Meta in tre dimensioni: 8B per latenza, 70B per intelligenza. Quantizzato in Q4_K_M o Q8. Pesi aperti, nessuna restrizione. Open Weights · 8B bis 70B · Multi-Sprache
Large Language Model Mistral · DeepSeek Mistral 7B per velocità, Mistral Large 2 per contesti più lunghi. DeepSeek-V3 per attività specifiche del dominio. Tutti distribuibili su hardware cliente. Mistral 7B/Large · DeepSeek-V3 · Effizient
Perché questo mix di modelli: Llama domina per qualità e supporto della community, Mistral 7B per throughput, DeepSeek per ambiti specifici. Scegliamo in base al risultato sull'eval-set e ai requisiti di latenza — nessun vendor lock-in, i modelli restano sostituibili.

02 · Inferenza & Serving

Motore di inferenza grade-produzione — batching e ottimizzazione KV-cache.

vLLM è il nostro inference-server principale per GPU L40S e H100. Ollama per setup semplici o sviluppo locale. Entrambi consentono batching efficiente e pattern di cache persistenti.

Server di inferenza vLLM Server high-performance con prefix-caching, KV-cache dinamica, batched inference. Llama 3.1 70B in Q4_K_M su L40S: time-to-first-token P50 ~480 ms, P95 ~780 ms (batch_size=1). Prefix Caching · HNSW-Support · Batched · NVIDIA-native
Alternativa / Locale Ollama Alternativa semplificata eseguita localmente per sviluppo o proof-of-concept. Semplice per demo, ma meno opzioni di tuning rispetto a vLLM. Einfach · Cross-Platform · PoC-freundlich
Perché vLLM in produzione: Nativ auf NVIDIA GPUs optimiert, Caching-Features reduzieren Latenz um 30–50 %, Batching ermöglicht höheren Durchsatz. Ollama genügt für Piloten, aber vLLM ist der Standard für SLA-Workloads.

03 · Retrieval & Vettori

pgvector — vettori insieme ai tuoi dati aziendali.

Non un DB vettoriale separato (Pinecone, Weaviate). Invece: pgvector in PostgreSQL con indice HNSW. Un sistema di database, un regime di backup, nessuna complessità di sincronizzazione.

Ricerca vettoriale pgvector + HNSW PostgreSQL 16+ mit pgvector Extension. HNSW-Index für schnelle Nearest-Neighbor-Suche, IVFFlat für größere Korpora. Recall@5 > 95 % auf echten Kundendaten. HNSW · IVFFlat · PostgreSQL 16 · Sub-100ms
Fallback (solo >50M embedding) Qdrant · Pinecone Separate Vektor-DB nur wenn Corpus >50M Embeddings oder Strict P50 <50ms Latenz. Für 99 % der Mittelstands-Use-Cases overkill. Enterprise · Optional · Specialist
Perché pgvector è lo standard: Semplicità operativa (un backup DB, un sistema di monitoraggio), filtraggio scoped-tenant via SQL, insieme ai dati aziendali. Il benchmark mostra: più veloce e più economico dell'archiviazione esterna per embedding da 500k a 2M.

04 · Integrazione app & agenti

L'IA vive nel codice, non accanto ad esso.

L'agente IA è un'app o plugin Django. Chiamate di strumenti tramite API Anthropic/OpenAI native, log di audit per ogni chiamata dell'agente nel database.

Framework web Django 5.x Tutti gli agenti IA sono app o plugin Django. Accesso diretto ai modelli ORM (paziente, appuntamento, fattura), permessi, autenticazione. Distribuzione tramite processo Django standard. Django 5.0+ · ORM-native · Batteries-included
Pattern agente Tool-Calling + Audit Agenti tramite Claude/OpenAI/Llama tool-use. Ogni chiamata registrata in DB con utente, timestamp, input, output. Logica di rifiuto e comportamento di fallback definiti per agente. Tool-Use · Reflexion · Deterministic Fallback
Perché incorporato in Django: Nessun workflow Zapier, nessuna sincronizzazione via API esterna. Gli agenti hanno accesso diretto ai vostri modelli ORM, permessi e logica di business. Una codebase, un deploy, un audit-trail dei permessi.

05 · Metriche di qualità

Valutazione a 7 metriche — prima di ogni distribuzione.

Unser internes Eval-Harness läuft bei jedem Modell- oder Index-Wechsel. Drei Ground-Truth-Sets (Realität, Adversarial, Regression), automatisierte Reports, Regression-Blocking (>5 % blockt den Merge).

Le 7 metriche:
Recupero
recall@5
Ranking
MRR
Hit-rate
@1
Generazione
faithfulness
Rilevanza
answer-relevance
Sicurezza
refusal-rate
Processo di valutazione: Tre set per progetto: domande reali, casi limite e allucinazioni, query di regressione da 6–12 mesi. A ogni cambio di modello o indice viene generato un rapporto automatico. Una regressione superiore al 5% blocca il rilascio.
Valutazione in dettaglio — Engineering Note 01 →

06 · Conformità e protezione dei dati

Industrie regolamentate. Nessun accesso nascosto.

Tutti i componenti possono funzionare completamente on-premise. Conformità GDPR per architettura (non per carta), classificazione EU-AI-Act per ogni caso d'uso.

Sovranità dei dati On-Premise LLM, motore di embedding e DB vettoriale funzionano su hardware cliente nella loro rete. Nessun trasferimento di dati a terzi, conforme GDPR per design. Per autorità, studi legali, studi medici, industria. Vollständig dezentralisiert · Keine Cloud · Kein Datentransfer
Normativa EU AI Act · DSGVO Classificazione del rischio (minimo · limitato · rischio elevato), documentazione obbligatoria e audit di bias. Approccio pragmatico per il mercato medio — nessun parere legale di 200 pagine, solo ciò che è legalmente richiesto. Risk-Klassifizierung · Transparenz-Dokumentation · Audit-Trail
Perché architettura on-premise: Pianifichiamo hardware e gestione in base alle vostre esigenze. Prepariamo un’offerta personalizzata. Contattateci.
Conforme GDPR per architettura
Classificazione del rischio EU-AI-Act
Distribuibile on-premise · nessun vendor lock-in

Panoramica dello stack

Tutti i componenti insieme.

Questo stack è provato in diversi progetti cliente in produzione. Mantenibile a lungo termine, documentato e non vincolato a nessuna applicazione singola.

Livello Componente Logica
Modelle Llama 3.1, Mistral, DeepSeek Open Weights, on-premise deploybar, quantisierbar, austauschbar
Inferenz vLLM (Prod) oder Ollama (PoC) vLLM: Batching, KV-Cache, Prefix-Caching; Ollama: einfach & schnell
Retrieval pgvector in PostgreSQL + HNSW Vektoren neben Geschäftsdaten, ein Backup-System, tenant-scoped filtering
App-Layer Django 5.x + Tool-Calling KI sitzt im Code, direkter ORM-Zugriff, Audit-Logs pro Call
Evaluation 7-Metriken-Harness recall@5, MRR, hit-rate@1, faithfulness, answer-relevance, refusal-rate — vor jedem Deployment
Compliance On-Premise, DSGVO, EU AI Act Datensouveränität durch Design, Risikoklassifizierung pro Use-Case

Filosofia dell'architettura

Perché questo stack.

Componenti provate rispetto a strumenti di tendenza. Semplicità operativa sulla complessità. Meno parti mobili, meno da debuggare, meno da mantenere.

01 Benchmark reali, nessuna stima Tutti i componenti sono distribuiti in più progetti cliente. Latenza vLLM, recall pgvector, calibrazione metrica eval — tutto misurato su carichi di lavoro reali, non teorici.
02 Semplicità operativa Un solo sistema di database (PostgreSQL), nessun DB vettoriale separato. Un solo processo di deploy (Django), nessuna dipendenza da API esterne per il setup di base. Meno da proteggere, meno da monitorare.
03 Mantenibile a lungo termine Tutti i componenti sono open-source o servizi commerciali consolidati, attivamente mantenuti e senza dipendenze esoteriche. Ancora distribuito tra 3 anni senza chiedere ai fornitori.
04 Nessun accesso nascosto On-premise è opzionale ma standard per impostazione predefinita. Tutti i componenti possono funzionare su hardware proprio. Nessuna dipendenza cloud forzata per data residency o conformità.
Decisioni architettoniche in dettaglio — note di engineering →

Approfondimenti più profondi

Engineering Notes — benchmark e decisioni.

Questa pagina è una panoramica. Per i dettagli — numeri di latenza concreti, tuning dell'indice, metodologia di valutazione — vedi le nostre Engineering Notes.

Note 01 Valutazione RAG Eval-harness, costruzione del ground-truth, regression-blocking, calibrazione per misurazioni coerenti attraverso i cambi di modello. Alla nota →
Note 02 Llama 3.1 su L40S Quantizzazione, batching vLLM, tuning KV-cache, profili di latenza (P50/P95), dove si trova il ginocchio e quando una seconda GPU vale la pena. Alla nota →
Note 03 pgvector & Django ORM Perché pgvector su Pinecone, strategia dell'indice, parametri di tuning, confronto del recall, limiti dell'approccio, quando è necessario il DB vettoriale esterno. Alla nota →

Tecnologia & stack · documentato · idoneo on-premise

Schauen wir uns gemeinsam an, wie dieser Stack zu Ihrem Projekt passt.

Chiamata di 30 minuti. Analizziamo i tuoi requisiti e diciamo onestamente quali componenti hanno senso per te — e quali sono eccessivi. Nessun upsell, nessun hype, solo realtà dell'engineering.

+49 941 20 90 28 62

Risposta nei giorni lavorativi entro 24 ore · lun–ven 9–18 · CODLAB · St.-Jakob-Str. 6, 93161 Sinzing

Sviluppo documentato GDPR · server nell’UE, in Germania su richiesta Sviluppatore diretto · niente call center