Technologie
Wie wir unsere Agents bauen und betreiben — und warum dieselbe Architektur auch beim Kunden trägt. Wir wenden täglich an, was wir anbieten.
Inferenz-Infrastruktur
Mehrere Hosts mit NVIDIA-GPU-Beschleunigung, verbunden über ein privates Netzwerk-Mesh ohne öffentliche Ports. Modell-Routing über einen Proxy mit Failover-Chains: lokale Modelle für sensitive Workloads, Cloud-Anbindung als Eskalations-Pfad für komplexe Reasoning-Aufgaben.
Profile pro Use-Case (Coder, Reasoning, Concierge, Embedding, Vision), umschaltbar ohne Code-Änderung. Authentifizierung läuft über sicheren Schlüsselspeicher des Betriebssystems — keine API-Keys im Repository, keine in Umgebungsvariablen exportiert. Eine Erweiterung dieses Patterns wurde als Beitrag zum Open-Source-Agent-Framework Hermes eingereicht.
RAG mit Privacy-by-Construction
Vektorbasierte Wissensdatenbank mit harter Trennung zwischen kundenfreigegebenen Inhalten und internen Materialien. Die Trennung ist architektonisch garantiert, nicht per Filter: jede Indexer-Instanz schreibt ausschließlich in ihre eigene Collection und sieht ausschließlich ihren eigenen Mount-Pfad. Ein versehentliches Leak ist by-design ausgeschlossen.
Reindex läuft inkrementell auf Basis von Versionierungs-Diffs. Die Pipeline ist test-getrieben mit dedizierten Privacy-Probes — semantisch interne Anfragen müssen für die öffentliche Collection konsistent leer bleiben.
AI-Agent-Pattern
Klare Architektur über alle unsere Agents: Tag-Vertrag im Modell-Output statt freihändiger Tool-Calls, Konsens-Flow vor jeder Aktion, stateless im Frontend mit Renderer-seitiger Session-History. Keine personenbezogenen Daten persistiert.
Das Pattern ist mit Modellen jeder Größenordnung robust — vom Cloud-Frontier-Modell bis zur lokalen Mittelklasse — und passt zur DSGVO-Tonalität: das System fragt erst, handelt dann. Der Concierge-Agent dieser Website folgt exakt diesem Pattern.
Operations und Resilienz
Service-Landschaft ist Container-orchestriert mit Health-Checks, Restart-Policies und Failover pro Service. Wenn ein Standard-Stack einen Bug hat, wird er gefixt — Beispiel: ein Custom-Build des lokalen Inference-Engines wegen eines plattformspezifischen Crashs, parallel als Pull-Request beim Upstream-Projekt verfolgt.
Voice-Pipeline mit hardware-beschleunigter Transkription, echtzeitfähig auch bei längeren Audio-Sequenzen. Bild-Generierungs-Pipeline für interne Diagramme und Marketing-Material steht auf demselben Stack.
Engineering-Disziplin
Verbindliche Konventionen über alle Projekte:
- Konzept vor Implementation — keine größere Code-Änderung ohne vorgelagertes Architektur-Dokument und Freigabe.
- Funktionierende Implementierungen werden nicht verändert ohne expliziten Auftrag — Refactorings sind keine Rechtfertigung für Risiko.
- Pflichtdokumente pro Projekt: Architektur, Tech-Decisions mit Begründungen, Progress-Log, Security, Commit-Konventionen.
- Lizenz-Management mit Ampel-Logik (Apache-2.0/MIT/BSD freigegeben, GPL/AGPL nur mit Exception) — automatisierter Check pro Dependency.
- Test-getriebene Pipelines als Pflicht für Merges, nicht als Wunsch.
Was Kunden bekommen: ein Setup, das wir selbst betreiben, kennen und bei Bedarf bis auf den Engine-Bug-Fix verfolgen können. Plus die Konzept- und Test-Disziplin dahinter. Jede technische Aussage ist durch eigene Operations gedeckt.