Was wir tun
Die Daten an einen Ort bringen. Wir wählen die Quellen aus, die zählen, etwa Ihre Produktdatenbank, Billing, CRM und Werbeplattformen, und laden sie in ein Data Warehouse oder eine Postgres-Analysedatenbank. Die Rohdaten landen zuerst und bleiben verfügbar. Wo fertige Konnektoren günstiger sind als eigener Code, nutzen wir sie. Wo nicht, schreiben wir eigene Loader.
Einmal modellieren, in SQL. Transformationen liegen als SQL-Modelle in der Versionskontrolle, aufgebaut wie bei dbt: zuerst Staging, dann saubere Fachtabellen, dann die wenigen Tabellen, die Ihre Dashboards lesen. Jedes Modell hat Tests und eine kurze Beschreibung. Ändert sich eine Definition, ändert sie sich in einer Datei, und alle bekommen die neue Zahl.
Betrieb wie in der Produktion. Pipelines bekommen einen Orchestrator, Retries und ein Aktualitätsziel pro Tabelle. Datenqualitätsprüfungen erkennen Duplikate, Nullwerte und plötzliche Einbrüche bei der Zeilenzahl. Wenn etwas bricht, erreicht ein Alert jemanden, der es beheben kann, mit Runbook. Das ist dieselbe SRE-Praxis, die wir bei Systemen für Ihre Kunden anwenden, denn eine falsche Zahl in der Geschäftsführungsrunde ist auch ein Ausfall.
Die Rechnung im Rahmen halten. Bei einem Data Warehouse gibt man leicht zu viel aus. Wir schauen, welche Abfragen und Jobs am meisten kosten, setzen Partitionen und Zeitpläne, die zur tatsächlichen Nutzung passen, und geben Ihnen eine Kostenübersicht pro Quelle und pro Job.
Die Plattform an das Unternehmen anpassen. Ein Team von zehn Leuten braucht nicht den Stack einer Bank. Wir beginnen mit dem kleinsten Setup, das Ihre Fragen beantwortet, oft ein gemanagtes Postgres und ein Scheduler, und wechseln erst auf ein Cloud Data Warehouse, wenn Datenmenge oder Nutzerzahl es rechtfertigen. Alles ist als Code definiert, der nächste Schritt ist also eine Änderung und kein Neubau.
Wie es meistens abläuft
Die meisten Projekte beginnen mit dem zweiwöchigen Daten-Check-up. Wir verfolgen Ihre wichtigsten Kennzahlen von der Quelle bis zum Dashboard und finden heraus, wo sie abweichen oder verloren gehen. Daraus ergibt sich eine klare Liste, was die Plattform zuerst lösen muss.
Dann bauen wir in Iterationen von zwei Wochen, jeweils ein paar Quellen auf einmal. Dasselbe Team richtet die Infrastruktur ein und schreibt die Analysen darauf, es gibt also keine Übergabe zwischen einem Plattform-Dienstleister und einem Daten-Dienstleister. Wenn wir gehen, gehören Code, Konfiguration und Runbooks Ihrem Team.
Passt gut, wenn
- Ihre Reports lesen direkt aus den Produktionsdatenbanken und bremsen sie aus.
- Zwei Teams nennen zwei verschiedene Zahlen für dieselbe Sache.
- Letzten Monat ist eine Pipeline ausgefallen, und eine Woche lang hat es niemand gemerkt.
- Sie stellen bald die erste Person für Datenanalyse ein und wollen ihr eine saubere Arbeitsgrundlage geben.