MW.

Wybrane projekty

Dowody razem z ograniczeniami.

Produkt w budowie i cztery techniczne case studies — każde oddziela pytanie, metodę, raportowany wynik i to, czego dowód nie potrafi wykazać.

Moja soczewka ewaluacyjna

Od wyniku modelu do decyzji człowieka.

Tych samych pięciu pytań używam, żeby połączyć jakość techniczną z tym, co człowiek może bezpiecznie zdecydować.

  1. 01Potrzeba człowieka
  2. 02Dowód
  3. 03Test błędu
  4. 04Kontrola człowieka
  5. 05Granica twierdzenia
Przykład · Clinical RAG

Precyzyjny werdykt jest lepszy od szerokiej obietnicy.

Sprawdzono
Retrieval z qrels; raportowane P@3, R@3 i MRR.
Zaprojektowano
Odpowiedzi związane z cytowaniami i bezpieczne zachowanie przy braku dowodu.
Nie wykazano
Skuteczności klinicznej, prawdziwych danych pacjentów ani użyteczności dla personelu.

Werdykt: prototyp badawczy, nie produkt kliniczny.

Zobacz metodę i kod
FireBid Radar
Autorski produkt · w budowie

FireBid Radar

Evidence-first B2B SaaS projektowany, aby pomagać brytyjskim wykonawcom fire-safety znajdować właściwe zamówienia publiczne i prawdopodobne okna odnowień kontraktów.

01

Fakty oddzielone od prognoz

Prognoza odnowienia nie jest przedstawiana jako opublikowany przetarg. Dowody pozostają przypięte do sygnału.

02

Zaprojektowany dla konkretnej branży

Profile, deterministyczny matching i analiza odnowień koncentrują produkt na brytyjskich zamówieniach fire-safety.

03

Obecna granica dowodu

Zweryfikowano lokalny build i ścieżkę przeglądarkową; nie deklaruję jeszcze hosted CI, odbioru docelowego VPS ani gotowości produkcyjnej.

01 · RAG i ewaluacja

Clinical RAG na syntetycznych danych EHR

Badawczy prototyp wyszukiwania i odpowiedzi, w którym każda odpowiedź ma pozostać związana z dowodem oraz konkretnym pacjentem w syntetycznym zbiorze.

P@30,583
R@31,000
MRR1,000
Ewaluacja retrievalu na syntetycznym zbiorze EHR projektu.
P@3 0,583R@3 1,000MRR 1,000
Wyzwanie, metoda, dowód i ograniczenie
Wyzwanie

Zbudować sprawdzalny przepływ RAG dla fragmentów dokumentacji w stylu NHS bez używania prawdziwych danych pacjentów.

Metoda

Wyszukiwanie TF-IDF, qrels, odpowiedzi świadome cytowań, bezpieczne reakcje przy braku wsparcia w danych, testy pytest i dokumentacja założeń.

Dowód

Raportowane wyniki retrievalu: Precision@3 0,583, Recall@3 1,000 i MRR 1,000 w zdefiniowanej ewaluacji projektu.

Ograniczenie

Zbiór jest syntetyczny, a system jest prototypem akademickim — nie produktem klinicznym ani narzędziem medycznym.

02 · Computer vision

Sign Language MNIST od podstaw

Implementacja perceptronu i sieci feed-forward w NumPy, skupiona na jakości etykiet, analizie błędów i porównaniu modeli.

88,62%
Wyrównana dokładność wieloklasowaWynik benchmarku, nie rozpoznawanie języka migowego z kamery.
Accuracy 88,62%NumPy onlyError analysis
Wyzwanie, metoda, dowód i ograniczenie
Wyzwanie

Zrozumieć mechanikę uczenia sieci, implementując kluczowe elementy bez gotowej warstwy wysokiego poziomu.

Metoda

Backpropagation, regularyzacja, early stopping, porównanie modeli liniowych i nieliniowych oraz kontrola niespójności etykiet.

Dowód

Wyrównana dokładność wieloklasowa 0,8862 po udokumentowanej korekcie mapowania etykiet.

Ograniczenie

Wynik dotyczy benchmarku Sign Language MNIST; nie opisuje jakości systemu rozpoznającego rzeczywisty język migowy z kamery.

03 · Machine learning

Modelowanie popularności i gatunku Spotify

Reprodukowalny pipeline regresji i klasyfikacji z baseline’ami, inżynierią cech, walidacją i automatycznymi testami.

Kontrola danychBaseline’yCatBoost / SVCTest końcowy
Wynik ma sens dopiero wtedy, gdy dane, baseline i podział są jawne.
RMSE 6,52657Accuracy 57,14%Tested pipeline
Wyzwanie, metoda, dowód i ograniczenie
Wyzwanie

Oddzielić sygnał predykcyjny od atrakcyjnie brzmiącej, lecz słabo uogólniającej historii o danych muzycznych.

Metoda

CatBoost dla regresji, Linear SVC dla klasyfikacji, porównanie modeli, figury diagnostyczne i testy jakości danych.

Dowód

Raportowany benchmark RMSE 6,52657 oraz dokładność klasyfikacji 0,57142.

Ograniczenie

Wyniki są zależne od zbioru, podziału i skali celu. Projekt dokumentuje ryzyko przeuczenia i nie jest produkcyjnym systemem rekomendacji.

04 · Optymalizacja

Strategia ilościowa i algorytm genetyczny

Chronologiczna ewaluacja 15-parametrowej strategii z kosztami transakcyjnymi i kilkoma punktami odniesienia.

Zwrot OOS7.50%Max DD9.99%
Dwie różne miary: zwrot i ryzyko spadku. Historyczne, nie prognostyczne.
OOS 7,50%Max DD 9,99%Chronological split
Wyzwanie, metoda, dowód i ograniczenie
Wyzwanie

Ograniczyć ryzyko dopasowania strategii do historii i sprawdzić ją na danych poza próbą.

Metoda

Podział train/test zgodny z czasem, random search, reguła stała i buy-and-hold jako baseline’y oraz jawne koszty transakcyjne.

Dowód

Raportowany zwrot out-of-sample 7,50% przy maksymalnym obsunięciu 9,99%.

Ograniczenie

Projekt badawczy, nie porada inwestycyjna. Wynik historyczny nie przewiduje przyszłego zwrotu i wymaga interpretacji razem z okresem oraz benchmarkiem.