Technologie

Wie wir unsere Agents bauen und betreiben — und warum dieselbe Architektur auch beim Kunden trägt. Wir wenden täglich an, was wir anbieten.

Inferenz-Infrastruktur

Mehrere Hosts mit NVIDIA-GPU-Beschleunigung, verbunden über ein privates Netzwerk-Mesh ohne öffentliche Ports. Modell-Routing über einen Proxy mit Failover-Chains: lokale Modelle für sensitive Workloads, Cloud-Anbindung als Eskalations-Pfad für komplexe Reasoning-Aufgaben.

Profile pro Use-Case (Coder, Reasoning, Concierge, Embedding, Vision), umschaltbar ohne Code-Änderung. Authentifizierung läuft über sicheren Schlüsselspeicher des Betriebssystems — keine API-Keys im Repository, keine in Umgebungsvariablen exportiert. Eine Erweiterung dieses Patterns wurde als Beitrag zum Open-Source-Agent-Framework Hermes eingereicht.

RAG mit Privacy-by-Construction

Vektorbasierte Wissensdatenbank mit harter Trennung zwischen kunden­freigegebenen Inhalten und internen Materialien. Die Trennung ist architektonisch garantiert, nicht per Filter: jede Indexer-Instanz schreibt ausschließlich in ihre eigene Collection und sieht ausschließlich ihren eigenen Mount-Pfad. Ein versehentliches Leak ist by-design ausgeschlossen.

Reindex läuft inkrementell auf Basis von Versionierungs-Diffs. Die Pipeline ist test-getrieben mit dedizierten Privacy-Probes — semantisch interne Anfragen müssen für die öffentliche Collection konsistent leer bleiben.

AI-Agent-Pattern

Klare Architektur über alle unsere Agents: Tag-Vertrag im Modell-Output statt freihändiger Tool-Calls, Konsens-Flow vor jeder Aktion, stateless im Frontend mit Renderer-seitiger Session-History. Keine personenbezogenen Daten persistiert.

Das Pattern ist mit Modellen jeder Größenordnung robust — vom Cloud-Frontier-Modell bis zur lokalen Mittelklasse — und passt zur DSGVO-Tonalität: das System fragt erst, handelt dann. Der Concierge-Agent dieser Website folgt exakt diesem Pattern.

Operations und Resilienz

Service-Landschaft ist Container-orchestriert mit Health-Checks, Restart-Policies und Failover pro Service. Wenn ein Standard-Stack einen Bug hat, wird er gefixt — Beispiel: ein Custom-Build des lokalen Inference-Engines wegen eines plattform­spezifischen Crashs, parallel als Pull-Request beim Upstream-Projekt verfolgt.

Voice-Pipeline mit hardware-beschleunigter Transkription, echtzeitfähig auch bei längeren Audio-Sequenzen. Bild-Generierungs-Pipeline für interne Diagramme und Marketing-Material steht auf demselben Stack.

Engineering-Disziplin

Verbindliche Konventionen über alle Projekte:

  • Konzept vor Implementation — keine größere Code-Änderung ohne vorgelagertes Architektur-Dokument und Freigabe.
  • Funktionierende Implementierungen werden nicht verändert ohne expliziten Auftrag — Refactorings sind keine Rechtfertigung für Risiko.
  • Pflichtdokumente pro Projekt: Architektur, Tech-Decisions mit Begründungen, Progress-Log, Security, Commit-Konventionen.
  • Lizenz-Management mit Ampel-Logik (Apache-2.0/MIT/BSD freigegeben, GPL/AGPL nur mit Exception) — automatisierter Check pro Dependency.
  • Test-getriebene Pipelines als Pflicht für Merges, nicht als Wunsch.

Was Kunden bekommen: ein Setup, das wir selbst betreiben, kennen und bei Bedarf bis auf den Engine-Bug-Fix verfolgen können. Plus die Konzept- und Test-Disziplin dahinter. Jede technische Aussage ist durch eigene Operations gedeckt.