Mgr. Petr Novák, Ph.D.

Závěrečné práce

Bakalářské práce

Odhady parametrů v modelu zrychleného času

Autor
Martin Benedikt
Rok
2024
Typ
Bakalářská práce
Vedoucí
Mgr. Petr Novák, Ph.D.
Oponenti
Ing. Jitka Hrabáková, Ph.D.
Anotace
Bakalářská práce se zaměřuje na implementaci odhadu regresních parametrů u semiparametrického modelu zrychleného času. V práci je postupně představena analýza přežití, přístup k analýze přežití pomocí čítacích procesů a regresní modelování v analýze přežití. Poté následují kapitoly, kde se detailně popisují zvolené metody odhadu regresních parametrů a sestavený R balíček. Vybrané metody jsou v závěru otestovány jak na reálných, tak na simulovaných datech. Na umělých datech je provedena simulační studie, kde jsou vybrané postupy testovány v několika vybraných scénářích s různou procentuální mírou cenzorování, velikostí vzorků a různými rozděleními odchylek modelu. Praktický výsledek práce je naimplementovaný R balíček, který realizuje vybrané metody odhadu regresních koeficientů a obsahuje všechny potřebné nástroje pro semiparametrickou analýzu cenzorovaných dat.

Predikce pravděpodobnosti vítězství ve hře League of Legends

Autor
Adam Czak
Rok
2025
Typ
Bakalářská práce
Vedoucí
Mgr. Petr Novák, Ph.D.
Oponenti
Ing. Jitka Hrabáková, Ph.D.
Anotace
Práce se zabývá analýzou a identifikací optimální metody pro predikci vítězství v týmové hře League of Legends. Studie využívá logistickou regresi, dopředné neuronové sítě a rekurentní neuronové sítě. Výzkum zahrnoval získání a zpracování rozsáhlé datové sady obsahující přibližně 165 000 zápasů. Modely byly porovnávány na základě přesnosti, F1 skóre a očekávané kalibrační chyby (expected ealibration error, ECE). Jako nejefektivnější se ukázal model logistické regrese, který dosáhl přesnosti 72,49 % a hodnoty ECE 0,0062 na testovacích datech. Hlavním výsledkem této práce je vyhodnocení vhodnosti různých přístupů strojového učení pro problém predikce vítězství v průběhu zápasu v League of Legends.

Modelování trendů ve vývoji populace světových zemí

Autor
Dominik Bursa
Rok
2025
Typ
Bakalářská práce
Vedoucí
Mgr. Petr Novák, Ph.D.
Oponenti
doc. Ing. Pavel Hrabák, Ph.D.
Anotace
Tato bakalářská práce se zabývá modelováním trendů ve vývoji populace světových zemí. Práce se zaměřuje na prozkoumání a aplikaci moderních statistických metod pro modelování časových řad s důrazem na využití vysvětlujících proměnných. Teoretická část představuje základní koncepty časových řad, statistické charakteristiky, stochastické procesy a modely vhodné pro predikci populace, jako je lineární regrese, modely ARIMA a náhodné lesy. Praktická část popisuje sběr a předzpracování dat o populaci a relevantních socioekonomických ukazatelích z veřejných zdrojů. Následně jsou na těchto datech natrénovány a porovnány tři různé modely s různými přístupy, včetně řešení problematiky sezónnosti, detekce změn v trendech a detekce odlehlých hodnot. Výkonnost modelů je hodnocena pomocí metrik střední kvadratické chyby (RMSE) a střední absolutní procentuální chyby (MAPE). Na základě těchto metrik se jako nejpřesnější ukázal model ARIMAX, který dosáhl nejnižší hodnoty MAPE jak pro krátkodobou (0.0092), tak i pro dlouhodobou predikci (0.0200), čímž efektivně kombinuje časovou strukturu dat s vlivem exogenních proměnných.

Modelování výkonnosti hráčů NHL s využitím regrese a shlukování

Autor
Jan Liška
Rok
2026
Typ
Bakalářská práce
Vedoucí
Mgr. Petr Novák, Ph.D.
Oponenti
Ing. Karel Klouda, Ph.D.
Anotace
V této bakalářské práci byl vytvořen regresní model, který predikuje počet bodů hráčů NHL v základní části sezóny na základě dat z příslušné sezóny. Dále bylo provedeno shlukování statistik hráčů a získání identifikátorů shluků, které byly přidány regresním modelům jako nové příznaky za účelem zlepšení MSE. Ze všech vyzkoušených shlukovacích algoritmů měl největší přínos algoritmus k-means, jehož identifikátory pomohly snížit validační MSE u hřebenové regrese z 42,76 na 40,56. Nejlepších výsledků z vyzkoušených regresních modelů dosáhla neuronová síť bez využití identifikátorů shluků a v testovací množině dat predikovala správně počet bodů s tolerancí pěti bodů u 79,85 % hráčů.

Odhady parametrů v robustní regresi

Autor
Viet Duc Chu
Rok
2026
Typ
Bakalářská práce
Vedoucí
Mgr. Petr Novák, Ph.D.
Oponenti
Ing. Jitka Hrabáková, Ph.D.
Anotace
Tato bakalářská práce se zabývá nedávno publikovanými iterativními přís- tupy k odhadu parametrů robustních regresních metod, které nemají explic- itní řešení. Zaměřuje se na stagewise truncated IRLS (STIR) a jeho vari- antu s gradientním sestupem (STIR-GD). Testujeme nové přístupy na běžném benchmarkovém datasetu Stack Loss a na syntetických datech s různými typy kontaminace. Nové metody jsou porovnány s klasickými metodami z hlediska relativní chyby odhadů parametrů, počtu iterací a doby běhu. Výsledky ukazují, že nové metody poskytují lepší robustnost vůči kontaminaci ve srovnání s metodou ne- jmenších čtverců a klasickým IRLS M-odhadem s Huberovou ztrátovou funkcí. Nové metody také vykazují rychlejší konvergenci ve srovnání s klasickou IRLS, zejména při inicializaci z špatného počátečního odhadu. Hlavním přínosem této práce je implementace a optimalizace nových iter- ativních metod pro robustní regresi.

Modelování cen kryptoměn s využitím analýzy mediálního sentimentu

Autor
Matouš Bohoněk
Rok
2026
Typ
Bakalářská práce
Vedoucí
Mgr. Petr Novák, Ph.D.
Oponenti
Ing. Mgr. Ladislava Smítková Janků, Ph.D.
Anotace
Tato práce navrhuje pipeline založenou na velkých jazykových modelech (LLM) pro extrakci příznaků z mediálního proudu o kryptoměnách a empiricky vyhodnocuje, které z těchto příznaků zlepšují krátkodobé predikce realizované volatility. Inženýrská část zahrnuje systém pro sběr dat v reálném čase z RSS kanálů, Telegramu a denního indexu Crypto Fear and Greed Index ukládající články do databáze ClickHouse a multi-agentový extraktor založený na LLM, který odděluje detekci věcných událostí (Fact Classifier) od měření emočního tónu (Emotion Classifier). Empirická část kombinuje OLS HAR-X regresi s NeweyWest HAC standardními chybami, sdružené Wald F-testy pro bloky příznaků a BenjaminiHochberg FDR korekci vícenásobných testů na 21-příznakové inventuře mimo HAR; tři experimenty jsou prezentovány na horizontu H = 4 h pro Cardano (ADA) a Solanu (SOL): nulový výsledek testu směrovosti binárních BULLISH/BEARISH štítků LLM, HAR-X test významnosti zakončený auditem jediného LLM-sémantického příznaku, který prvotně prochází BH-FDR, jakožto proxy pokrytí články, a ilustrativní charakterizace anomálního detektoru s posuvným z-skóre nad přežívajícím příznakem. Hlavní závěr: amplifikace (log_2(1+n_článků) · log_2(1+n_zdrojů)) deterministická statistika počtu článků počítaná bez volání LLM je jediný příznak doručený pipelinou mimo HAR, který po auditu přežívá BH-FDR na obou mincích s pozitivním koeficientem a obhájitelného významu; zdánlivý signál fact_factual_confidence je artefaktem proxy pokrytí články, způsobeným tím, že LLM není volán na buckety bez článků, a žádný LLM-sémantický příznak po tomto auditu nereplikuje pozitivní znaménko napříč oběma mincemi.

Predikce výsledků utkání ve stolním tenise

Autor
David Lorenc
Rok
2026
Typ
Bakalářská práce
Vedoucí
Mgr. Petr Novák, Ph.D.
Oponenti
Ing. Jana Vacková, Ph.D.
Anotace
Cílem této bakalářské práce je vytvoření algoritmu, který predikuje výsledky utkání ve stolním tenise v prostředí českých soutěží. Predikce jsou založeny na datech ze zápasů v uplynulé sezóně. Teoretická část zkoumá základy statistiky ve stolním tenise a využitelnost metod strojového učení ve sportu. Data nezbytná pro trénování modelu byla získána vlastním automatizovaným sběrem z oficiálního portálu STIS a následně vhodně předzpracována. V rámci práce byly otestovány tři algoritmy: logistická regrese, náhodný les a XGBoost. Nejvyšší přesnost vykazovala logistická regrese s 75,42 % na testovací množině. Tento model byl následně využit v navrženém algoritmu predikujícím celkový výsledek týmového utkání. Ten dosáhl přesnosti predikce 80 % v profesionální Extralize a 65 % v nižších soutěžích.