Nieuws

Van verspreide datasilo's naar één centrale databron

Door Redactie3 min leestijd

In veel organisaties ontstaat data op plekken die weinig met elkaar te maken lijken te hebben: een verkoopafdeling houdt cijfers bij in een eigen systeem, een productieomgeving logt sensordata apart, en de financiële administratie draait op weer een ander pakket. Elk systeem is op zichzelf logisch ontstaan, vaak jaren na elkaar aangeschaft voor een specifiek doel. Het probleem ontstaat pas wanneer iemand een vraag wil beantwoorden die meerdere afdelingen raakt, en blijkt dat niemand de cijfers uit die systemen zomaar met elkaar kan vergelijken. Zo’n vraag lijkt in eerste instantie eenvoudig, maar leidt dan alsnog tot dagenlang handmatig uitzoekwerk voordat er een betrouwbaar antwoord ligt.

Hoe datasilo’s ontstaan

Silo’s ontstaan zelden met opzet. Ze zijn meestal het gevolg van praktische keuzes op verschillende momenten: een afdeling koopt een tool die op dat moment goed aansluit bij haar behoefte, zonder rekening te houden met wat andere afdelingen gebruiken. Na een paar jaar groei heeft een organisatie dan tientallen systemen die ieder hun eigen versie van de waarheid bijhouden, vaak zonder dat iemand nog precies weet welk systeem voor welke vraag leidend hoort te zijn. Rapportages tussen afdelingen komen niet overeen, cijfers moeten handmatig worden samengevoegd in spreadsheets, en iedere update van een van de bronsystemen betekent dat dat handwerk opnieuw moet gebeuren.

Wat een centrale databron anders maakt

Een enterprise data platform probeert dit op te lossen door structuur aan te brengen: gestructureerde en ongestructureerde data uit verschillende bronnen komen samen op één plek, met eenduidige regels over hoe die data wordt opgeschoond, gecontroleerd op kwaliteit en beschikbaar gemaakt. In plaats van dat elke afdeling zelf een export maakt en die handmatig bewerkt, werkt iedereen vanuit dezelfde onderliggende dataset. Dat betekent niet dat alle informatie op één fysieke plek hoeft te staan, wel dat er één consistente laag is waar rapportages en analyses op worden gebaseerd.

Waarom dit meer is dan een technische verhuizing

Het samenbrengen van data is niet alleen een kwestie van systemen koppelen. Governance, oftewel afspraken over wie welke data mag inzien, aanpassen of gebruiken voor analyse, is minstens zo belangrijk. Zonder die afspraken ontstaat er al snel een nieuwe vorm van chaos, ditmaal binnen één platform in plaats van verspreid over meerdere systemen. Kwaliteitscontrole hoort daar ook bij: data die inconsistent of verouderd is, levert nog steeds onbetrouwbare rapportages op, ook als die rapportages nu wel uit één bron komen. Het samenbrengen van data lost dus pas iets op als daarna ook wordt bijgehouden of die data actueel en juist blijft.

Van losse rapportages naar realtime inzicht

Zodra data eenmaal gestructureerd samenkomt, wordt het mogelijk om analyses en dashboards in te bedden die continu worden bijgewerkt, in plaats van rapportages die eens per maand handmatig worden samengesteld. Beslissingen kunnen dan worden genomen op basis van wat er op dit moment speelt, in plaats van op cijfers die alweer enkele weken oud zijn tegen de tijd dat ze op tafel liggen. Dat opent ook de deur naar geavanceerdere toepassingen, zoals machine learning op basis van de volledige dataset in plaats van een steekproef uit één afdeling. Voor organisaties die nog met verouderde, aan elkaar geknoopte systemen werken, is dit vaak de belangrijkste reden om een moderniseringstraject te overwegen.

Ervaring in de praktijk

Crystalloids bouwt al meer dan tien jaar dit soort platforms op Google Cloud voor organisaties die hun verspreide databronnen willen samenbrengen. Die ervaring laat zien dat de grootste winst niet zit in nieuwe technologie op zich, maar in het wegwerken van de silo’s die jarenlang ongemerkt zijn ontstaan. Wat begint als een technisch project, eindigt meestal als een organisatorische verandering in hoe teams met data omgaan.