Získávání užitečných dat z obtížně dostupných zdrojů.
Vytvářím workflow pro sběr dat z webů, API, souborů a dalších digitálních zdrojů a následně organizuji získané informace do struktur, které lze skutečně využít pro analýzu.
Jsem datový analytik s magisterským vzděláním v oboru ekonomická analýza dat, zaměřený na dolování dat, statistické modelování, kvalitu dat a praktická analytická workflow v Pythonu, R a SQL.
Moje práce stojí na pomezí dolování dat, datové analýzy, statistického modelování a praktického data engineeringu. Zajímají mě zejména situace, kdy jsou informace roztříštěné, nekonzistentní, duplicitní nebo obtížně přímo analyzovatelné.
Namísto toho, abych analýzu chápal jako závěrečný krok oddělený od samotných dat, pracuji raději napříč celým řetězcem: sběr informací, kontrola kvality, restrukturalizace datasetů, modelování vztahů, validace výsledků a vysvětlení toho, co výstup skutečně znamená.
Vysoká škola ekonomická v Praze · Fakulta informatiky a statistiky
Formální vzdělání ve statistických a analytických metodách používaných ke zkoumání vztahů, nejistoty, struktury a změn v komplexních datasetech.
Vytvářím workflow pro sběr dat z webů, API, souborů a dalších digitálních zdrojů a následně organizuji získané informace do struktur, které lze skutečně využít pro analýzu.
Pracuji s chybějícími hodnotami, nekonzistentními schématy, anomálními záznamy, duplicitními pozorováními a validačními pravidly dříve, než se na data spoléhám při modelování nebo reportingu.
Můj statistický toolkit zahrnuje regresi, testování hypotéz, clustering, PCA, faktorovou analýzu, korespondenční analýzu, klasifikační metody a diagnostiku modelů.
Vyvinul jsem přístupy založené na machine learningu a grafových metodách pro detekci duplicit, fuzzy matching záznamů, kontrolu tranzitivity a rekonsiliaci na úrovni entit.
Moje diplomová práce se zaměřila na duplicitní inzeráty nájemního bydlení v online realitních datech. Navrhl jsem end-to-end workflow, které inzeráty sbíralo a čistilo, vytvářelo párové similarity features, trénovalo klasifikátory Random Forest a řešilo konfliktní duplicitní vztahy pomocí grafových metod.
Projekt vyžadoval jak analytické modelování, tak pečlivou práci s kvalitou dat, protože cílem nebylo pouze predikovat duplicitní páry, ale rekonstruovat spolehlivější populaci jedinečných nemovitostí pro následnou analýzu trhu.
Prozkoumat Entity ResolutionNejprve definuji obchodní nebo analytický problém a teprve potom vybírám metodu, model nebo nástroj.
Příprava dat, předpoklady modelování a finální rozhodnutí by měly zůstat kontrolovatelné a nezmizet uvnitř černé skříňky.
Finální výsledek by měl dávat smysl člověku, který jej potřebuje použít, ať už jde o dataset, analýzu, model nebo automatizovaný nástroj.
Napište mi, co potřebujete sbírat, čistit, propojovat, pochopit nebo automatizovat. Pomohu převést problém do konkrétního analytického projektu.