Stack & Architettura
Componenti pronte per la produzione — documentati e intercambiabili.
Il nostro stack tecnologico è una panoramica consolidata di tutti i sistemi che distribuiamo nelle soluzioni AI personalizzate. Tutti i componenti sono open-source o disponibili in commercio, mantenibili a lungo termine e non vincolati a un singolo modello o strumento. Le decisioni architetturali complete e i benchmark sono disponibili nelle nostre Engineering Notes.
01 · Modelli
LLM open-source, deployabili on-premise.
Wir arbeiten mit bewährten Open-Source-Modellen, die sich zu 100 % auf Kundenhardware deployen lassen. Die Modellwahl erfolgt nach Anforderung, nicht nach Marketing-Budget.
02 · Inferenza & Serving
Motore di inferenza grade-produzione — batching e ottimizzazione KV-cache.
vLLM è il nostro inference-server principale per GPU L40S e H100. Ollama per setup semplici o sviluppo locale. Entrambi consentono batching efficiente e pattern di cache persistenti.
03 · Retrieval & Vettori
pgvector — vettori insieme ai tuoi dati aziendali.
Non un DB vettoriale separato (Pinecone, Weaviate). Invece: pgvector in PostgreSQL con indice HNSW. Un sistema di database, un regime di backup, nessuna complessità di sincronizzazione.
04 · Integrazione app & agenti
L'IA vive nel codice, non accanto ad esso.
L'agente IA è un'app o plugin Django. Chiamate di strumenti tramite API Anthropic/OpenAI native, log di audit per ogni chiamata dell'agente nel database.
05 · Metriche di qualità
Valutazione a 7 metriche — prima di ogni distribuzione.
Unser internes Eval-Harness läuft bei jedem Modell- oder Index-Wechsel. Drei Ground-Truth-Sets (Realität, Adversarial, Regression), automatisierte Reports, Regression-Blocking (>5 % blockt den Merge).
06 · Conformità e protezione dei dati
Industrie regolamentate. Nessun accesso nascosto.
Tutti i componenti possono funzionare completamente on-premise. Conformità GDPR per architettura (non per carta), classificazione EU-AI-Act per ogni caso d'uso.
Panoramica dello stack
Tutti i componenti insieme.
Questo stack è provato in diversi progetti cliente in produzione. Mantenibile a lungo termine, documentato e non vincolato a nessuna applicazione singola.
| Livello | Componente | Logica |
|---|---|---|
| Modelle | Llama 3.1, Mistral, DeepSeek | Open Weights, on-premise deploybar, quantisierbar, austauschbar |
| Inferenz | vLLM (Prod) oder Ollama (PoC) | vLLM: Batching, KV-Cache, Prefix-Caching; Ollama: einfach & schnell |
| Retrieval | pgvector in PostgreSQL + HNSW | Vektoren neben Geschäftsdaten, ein Backup-System, tenant-scoped filtering |
| App-Layer | Django 5.x + Tool-Calling | KI sitzt im Code, direkter ORM-Zugriff, Audit-Logs pro Call |
| Evaluation | 7-Metriken-Harness | recall@5, MRR, hit-rate@1, faithfulness, answer-relevance, refusal-rate — vor jedem Deployment |
| Compliance | On-Premise, DSGVO, EU AI Act | Datensouveränität durch Design, Risikoklassifizierung pro Use-Case |
Filosofia dell'architettura
Perché questo stack.
Componenti provate rispetto a strumenti di tendenza. Semplicità operativa sulla complessità. Meno parti mobili, meno da debuggare, meno da mantenere.
Approfondimenti più profondi
Engineering Notes — benchmark e decisioni.
Questa pagina è una panoramica. Per i dettagli — numeri di latenza concreti, tuning dell'indice, metodologia di valutazione — vedi le nostre Engineering Notes.
Tecnologia & stack · documentato · idoneo on-premise
Schauen wir uns gemeinsam an, wie dieser Stack zu Ihrem Projekt passt.
Chiamata di 30 minuti. Analizziamo i tuoi requisiti e diciamo onestamente quali componenti hanno senso per te — e quali sono eccessivi. Nessun upsell, nessun hype, solo realtà dell'engineering.