Ewaluacja produktu z LLM bez lekarza w zespole

Wstęp Biorąc pod uwagę dotychczasową treść na blogu, nowy czytelnik może pomyśleć, że jestem developerem, który na co dzień zajmuje się pracą z małymi modelami i hardwarem. To byłoby oczywiście bardzo miłe, ale również bardzo nieprawdziwe;) Od początku swojej kariery zawodowej w IT jestem związany z testowaniem oprogramowania, a w aktualnym miejscu pracy zajmuję się testowaniem aplikacji medycznych ze szczególnym naciskiem na ewaluację działania modeli LLM. Impulsem do tego wpisu był odcinek podcastu “Dodane do backlogu” o tytule “Jak budować produkty AI: Evals i rola PM-a w erze LLM”. Pojawił się tam wątek roli QA, która może być dobrym pomostem do przyszłej pozycji “walidatora”. To stanowisko, które nie ma jeszcze de facto oficjalnej nazwy i jasno zarysowanego zakresu obowiązków, ale jest związane z ewaluacją aplikacji korzystających z LLM. W związku z tym, że ostatnio pracuję nad stworzeniem procesu ewaluacji do jednej z naszych aplikacji, mam parę przemyśleń, które chciałbym, żeby ze mną zostały. Najlepszym sposobem będzie ich spisanie, więc dzisiejszy post będzie raczej próbą uporządkowania pojedynczych myśli, które pojawiły mi się w ciągu ostatnich tygodni. ...

10 lipca 2026 · 6 min

Czy maly model moze zastapic ify? Część druga

Powinienem napisać tego posta dawno temu, ale nie mogłem się do niego zebrać ponieważ uznałem, że to będzie ostatni post z serii, która początkowo miała liczyć sześć wpisów. Już wyjaśniam skąd taka decyzja. Dla przypomnienia - mój eksperyment polegał na sprawdzeniu jak mały model poradzi sobie w podejściu edge AI w kontekście interpretacji docierających sygnałów i wyborze odpowiedniego toola. Tutaj można poczytać więcej o założeniach. Punktem wyjścia dla wszystkich eksperymentów była weryfikacja modelu bazowego, aby mieć punkt odniesienia. Tak jak widać poniżej, model bez żadnych modyfikacji radzi sobie bardzo przyzwoicie osiagając prawie 80% w obydwu kategoriach. Dla przypomnienia używam Qwena w rozmiarze 0.6B. Model miał ustawioną flagę /no_think, temperatura wynosiła 0, a średnie latency na jedno zapytanie to ~4s. Dodatkowo w trakcie testu modelu bazowego zweryfikowałem również opcje z włączonym reasoningiem, ale zysk wzrósł o 3 punkty procentowe przy latency, które zwiększyło się do ~29s. Tak mała różnica w wyniku nie usprawiedliwiała tak dużej różnicy w prędkości. ...

4 lipca 2026 · 3 min

Po hakatonie: wnioski na gorąco

To jest wpis dla mnie z przyszłości. Chciałbym na gorąco spisać wnioski po hakatonie. 1. To nie będzie nic odkrywczego, ale najważniejszy na hakatonie jest pomysł, którego nie robi się na siłę. Paint Match nie jest nowym lub odkrywczym produktem, ale dzięki temu, że sam sklejam modele i w dzieciństwie uwielbiałem grać w Airfix Dogfighter, to praca nad nim była przyjemnością. To bardzo pomaga w motywacji do dalszej pracy. Zdaję sobie sprawę, że nie zawsze da się powiązać pomysł z hobby, więc niech to, nad czym pracujesz, będzie dla Ciebie interesujące. Nie ma nic gorszego niż praca na siłę. ...

13 czerwca 2026 · 3 min

[EN] Paint match: first hackathon, first VLM on a board

A quick note before you start: I wrote this post during the hackathon, before fine-tuning the model. The current production state (with a new model) is described in the Update section at the end. I know I was supposed to describe the next experiments I’m running as part of EDGE AI, but last Wednesday an email from Hugging Face landed in my inbox with news about the Build Small Hackathon. I have to admit this hackathon is special, because the central theme is small models up to 32B. Could there have been a more interesting topic? I honestly doubt it! ...

9 czerwca 2026 · 9 min

Paint match: pierwszy hakaton, pierwszy VLM na płytce

Krótka uwaga zanim zaczniesz: post pisałem w trakcie hakatonu, jeszcze przed fine-tuningiem modelu. Aktualny stan produkcji (z nowym modelem) opisany w sekcji Aktualizacja na końcu. Zdaje sobie sprawę z tego, że miałem opisać kolejne eksperymenty, które przeprowadzam w ramach EDGE AI, ale w poprzednią środę na moją skrzynkę trafił mail z Hugging Face z informacją na temat hakatonu Build Small Hackathon. Muszę przyznać, że ten hakaton jest wyjątkowy, ponieważ motywem przewodnim są małe modele do 32B. Czy mogł trafić się ciekawszy temat? Szczerze wątpię! ...

9 czerwca 2026 · 7 min

Czy mały model może zastąpić ify?

Tym wpisem zaczynam całą serię postów związanych z moim aktualnym projektem - nazwałem go roboczo Edge AI. Celem projektu jest odpowiedź na pytanie czy model Qwen3-0.6B nadaje się do zastosowania w kontekście Edge AI. Na potrzeby projektu przyjąłem założenie, że wdrożenie zostało wykonane w firmie logistycznej. Od razu zaznaczę, że nie mam doświadczenia w tej branży więc chodzi tylko o zakotwiczenie projektu w “przemysłowej” narracji. Doszedłem do wniosku, że dzięki temu małemu zabiegowi projekt będzie bardziej rzeczywisty. ...

24 maja 2026 · 3 min

LLM w teorii

Ostatnio doszedłem do wniosku, że tak naprawdę nie wiem jak działają LLMy. Rozumiem ich działanie od strony praktycznej, ale część teoretyczną rozumiem raczej hasłowo. Uznałem, że to dobry pomysł na aplikację więc rozpisałem zadania i przez weekend zbudowałem ją z pomocą Clauda. Cały projekt jest hostowany na mojej płytce Radxa Q6A, która po raz kolejny okazała się jednym z najlepszych wydatków tego roku. Koncepcja jest bardzo prosta - przygotowałem syllabus zawierający 60 tematów pogrupowanych w bloki tematyczne. Codziennie o godzinie 8:30 dostępna jest nowa lekcja zawierająca świeże materiały. ...

20 maja 2026 · 2 min

Duże modele są nudne

Śledziłem wczoraj na Twitterze doniesienia z Google I/O 2026 i oczywiście doczekaliśmy się zapowiedzi nowych modeli. Poniżej wkleję te dwa największe: Gemini 3.5 Flash released Gemini 3.5 Pro announced Nie wiem czy to tylko mój problem, ale to ogłoszenie nie zrobiło na mnie żadnego wrażenia. Przypomniała mi się grafika, którą widziałem w jakimś poście i moim zdaniem doskonale oddaje to co się aktualnie dzieje: Nowe modele są po prostu nudne bo co miesiąc mamy nowy, lepszy LLM. To, że model jest lepszy objawia się po prostu wyższym wynikiem w jednym z syntetycznych testów takich jak SWE-Bench lub Humanity’s Last Exam: ...

20 maja 2026 · 3 min

Zmiana flow

Zmiana Nie wiem co mnie podkusiło, ale postanowiłem zmienić flow działania swojego asystenta. Nie znaczy to, że poprzednio działał źle. Model wielkości 0.6B całkiem dobrze radził sobie z moimi zadaniami biorąc pod uwagę, że nie wymagałem od niego nic ponad to co wcześniej sprawdziłem. Miał służyć głównie jako router do tool callingu. Pod względem wydajności sama zmiana nie ma za dużo sensu bo dokłada sporo dodatkowej logiki, plus bardzo “usztywniła” flow przepływu danych. Z drugiej strony była ciekawa pod względem edukacyjnym więc jestem zadowolony. ...

3 maja 2026 · 4 min

Jaki model wariacie?

Dygresja na początek. Minęło już trochę czasu od momentu w którym robiłem to co będę opisywać i przyznaję, że nie pamiętam już wszystkich szczegółów. Muszę nad tym popracować bo czuję, że to będzie problem w przyszłości. Problemy wieku dziecięcego Formalności mamy już za sobą więc przejdźmy do głównego tematu jakim będzie wybór małego modelu, który jest mózgiem mojego asystenta. Od samego początku chciałem żeby na nowej płytce pracował mały model i wiele obiecywałem sobie po dedykowanym procesorze na Radxa. Niestety jak to w życiu bywa sama specyfikacja techniczna bez oprogramowania nie działa i tak też było w tym przypadku. Oczywiście po części z mojej winy. Głównym winowajcą był system operacyjny, którego użyłem czyli Armbian. Nie wiem co mnie podkusiło, że wybrałem ten system zamiast zmodyfikowanej wersji Ubuntu dostarczanej przez producenta. W każdym razie poskutkowało to tym, że procesor NPU nie jest w tym momencie dostępny na żadnym systemie poza tym oferowanym przez Radxa. ...

19 kwietnia 2026 · 6 min