Uruchomienie bloga zostało sfinansowane przez społeczność ❤️
Mecenasem bloga jest Fundacja Zakłady Kórnickie,
wydawca portalu historycznego Hrabia Tytus

Benchmark PUMA: Malczewski, Wiedźmin i pomidorowa w testach modeli multimodalnych

Benchmark PUMA: Malczewski, Wiedźmin i pomidorowa w testach modeli multimodalnych

W benchmarku sprawdzono modele pracujące z tekstem, dźwiękiem i obrazem na 900 dość złożonych zadań odnoszących się do polskiej historii, kultury i życia codziennego. Czołowe modele uzyskały w tym teście w miarę dobre wyniki, polskie mogły być testowane tylko w niektórych kategoriach, a i tak poradziły sobie słabo. Okazuje się, że samo dostrojenie modelu do polskiego kontekstu kulturowego nie wystarcza. Może zamiast pracować nad modelami ogólnego przeznaczenia, lepiej rozwijać te specjalistyczne, dostosowane do niszowych zadań w polskiej administracji, nauce czy sektorze dziedzictwa?

Benchmark to nic innego jak ustandaryzowany test jakości i efektywności modeli sztucznej inteligencji. Wyniki takich testów, jeśli tylko wypracowywane są na podstawie standardowych metod, mogą być zestawiane i porównywane. Ciekawym rodzajem benchmarków są te badające możliwości modeli w pracy z materią kultury i dziedzictwa. Na blogu pisałem już o testowaniu modeli pod kątem polskiego egzaminu maturalnego z historii, rozpoznawaniu wpływów kultur narodowych na wiedzę modeli czy sprawdzaniu ich możliwości w analizach teologicznych.

Kompetencje kulturowe modeli

Badacze i badaczki z Ośrodka Przetwarzania Informacji - Państwowego Instytutu Badawczego opublikowali niedawno wyniki nowego benchmarku kilkudziesięciu modeli, które testowano w zadaniach związanych z polską historią, kulturą i dziedzictwem (DOI: 10.48550/arXiv.2608.21853, 2026). Celem testu była

ocena kompetencji językowych i kulturowych (linguistic and cultural competencies) dużych modeli w kontekście Polski i języka polskiego. Zadania obejmują trzy modalności: obrazy, dźwięk i dokumenty. Każda modalność zawiera trzy kategorie ukierunkowane na odrębne obszary wiedzy lub kompetencje praktyczne. Benchmark obejmuje zarówno zadania, które polegają na odpowiadaniu na pytania odnoszące się do kontekstu kulturowego, jak i zadania oceniające praktyczne możliwości w zakresie przetwarzania danych multimodalnych. Według naszej najlepszej wiedzy PUMA jest pierwszym polskojęzycznym benchmarkiem, który integralnie ocenia rozumienie obrazu, dźwięku i dokumentów w ramach jednego systemu, łącząc zadania osadzone kulturowo oraz praktyczne, takie jak ASR [Automatic Speech Recognition, czyli automatyczne rozpoznawanie mowy - MW], OCR i ekstrakcja informacji ustrukturyzowanych.

W celu przeprowadzenia testów przygotowano 900 zadań - niestety, tylko niektóre z nich podejrzeć można na stronie domowej benchmarku. Opublikowanie pełnego zestawu umożliwiłoby włączenie pytań i odpowiedzi do danych treningowych kolejnych wersji modeli, co podważyłoby efektywność przyszłych badań.

Test opisano skrótem PUMA (Polish Unified Multimodal Assessment), ponieważ zestaw badanych narzędzi obejmuje przede wszystkim modele multimodalne, pracujące nie tylko na tekście pisanym, ale też w dźwięku czy obrazie. W badanej grupie znalazły się także specjalistyczne modele pozwalające wyłącznie na pracę z dźwiękiem czy modele wykorzystywane do transkrypcji (OCR, HTR). Ich możliwości porównano z możliwościami czołowych modeli ogólnego przeznaczenia (frontier models) z rodziny Gemini, GPT czy Claude. Takie zróżnicowanie testowanych narzędzi i przygotowanych dla nich zadań odróżnia ten benchmark od speakleash/Polish_Cultural_Vision_Benchmark, w którym badano wyłącznie efektywność pracy z materiałami wizualnymi. PCVB wymagał przede wszystkim prostego rozpoznawania obiektów, zabytków, potraw lub postaci i identyfikowania kontekstu ich pochodzenia, zadania z benchmarku PUMA były już bardziej złożone.

Kilka ujawnionych przez zespół zadań pozwala dostrzec dość inkluzywny obraz współczesnej polskości, kształtowanej nie tylko przez historię i tradycję, ale też przez popkulturę, folklor i życie codzienne. W ramach benchmarku modele rozwiązywać miały zadania takie jak:

  • rozpoznanie i podstawowa interpretacja obrazu Jacka Malczewskiego Wigilia na Syberii (1892),
  • rozpoznanie zamku krzyżackiego w Malborku z wcale nie oczywistego wizerunku, identyfikacja jego budowniczych i daty przejęcia przez Królestwo Polskie,
  • wskazanie władcy Polski, który wybił pokazaną w zadaniu monetę,
  • identyfikacja tradycyjnych polskich zup na podstawie zdjęć,
  • rozpoznanie i uszeregowanie chronologiczne polskich gier komputerowych na podstawie kadrów (Cyberpunk 2077, Polanie, Wiedźmin, This War of Mine),
  • identyfikacja charakterystycznych polskich szczytów górskich, które oznaczono literami, a następnie uszeregowanie ich od najniższego do najwyższego za pomocą odpowiedniego zestawienia liter, wskazanie miast zaznaczonych na konturowej mapie Polski i ułożenie ich w porządku od północy do południa,
  • transkrypcja rozmowy radiowej między promami Jan Heweliusz a Mikołaj Kopernik z tragicznego 14 stycznia 1993 roku, transkrypcja poradnika audio na temat parzenia kawy w kawiarce (modelom zlecono zapis słowny wszystkich liczb i wartości),
  • rozpoznanie prawdziwości stwierdzeń wyrażanych w monologu wypowiedzianym w gwarze śląskiej, które dotyczyły m.in. zasad grillowania czy zachowania się podczas upałów,
  • rozpoznanie postaci na podstawie krótkiego biogramu audio Jana Czochralskiego i określenie zastosowania odkrytej przez niego metody otrzymywania monokryształów,
  • identyfikacja regionu Polski oraz charakterystycznego ludowego instrumentu perkusyjnego na podstawie nagrania występu zespołu ludowego (Kaszuby i diabelskie skrzypce),
  • rozpoznanie zwierząt na podstawie wydawanych przez nie dźwięków i wskazanie polskich regionów, w których stanowią część krajobrazu (owce - Podhale, Bieszczady i Beskidy),
  • zadania OCR i HTR: transkrypcja poplamionej kartki z pisanym ręcznie przepisem kulinarnym na “krokodylki” z ogórków, skanów starych gazet ze skomplikowanym układem stron,
  • wskazanie konkretnej trasy na schemacie planowanych stacji metra w Warszawie,
  • odpowiedzi na pytania dotyczące planu posiłków w przedszkolu (np. wskazanie alergenów),
  • ekstrakcja do JSON wskazanych danych z gazetek promocyjnych dyskontów (np. informacje o wartości rabatów na wybrane produkty) i dowodu osobistego.

Luka wydajnościowa

Nie wiemy niestety, czy polski kontekst, który próbowano dodać do standardowych zadań związanych z przetwarzaniem informacji, obejmował też mniej oczywiste artefakty, takie jak zdjęcia z marszów równości, tablice z wynikami ekstraklasy, memy odnoszące się do popularnych influencerów, trudne interpretacje historyczne czy fragmenty homilii. Nie jest to oczywiście zarzut dla organizatorów testów. Modele językowe można jednak badać jako miejsca pamięci i w tym, jak radzą sobie one z mniej oczywistymi i bardziej niszowymi tematami, dałoby się pewnie rozpoznać przejawy pewnej stronniczości. Podstawowym celem benchmarku PUMA było jednak sprawdzenie efektywności modeli w łączeniu informacji wyrażanych za pomocą różnych mediów (na tym właśnie polega multimodalność) z rozumieniem polskiego kontekstu. Tak czy inaczej zdefiniowana w zadaniach polskość nie była tu podstawowym zagadnieniem, proponowane modelom zadania miały przede wszystkim wymiar praktyczny.

Ważną cechą omawianego benchmarku było zastosowanie w ocenach testów ewaluacji deterministycznej (deterministic rule-based verification), czyli oparcie badania na zestawie konkretnych reguł, które pozwalały uniknąć używania modeli językowych jako sędziów. W literaturze przedmiotu bardzo często krytykuje się technikę LLM-as-a-Judge, podkreślając problemy ze stronniczością i powtarzalnością wyników.

Nie ma sensu przedstawiać tu wyników poszczególnych modeli, skoro są one dostępne (i aktualizowane) na stronie benchmarku - warto zwrócić uwagę, że tabelę rankingową można sortować i przełączać między zakładkami. Lepiej podsumować je ogólnie: oto najlepsze wyniki osiągnęły czołowe komercyjne modele ogólnego przeznaczenia z rodziny Gemini z modelem Gemini-3.1-Pro na czele. Użycie tego modelu do rozwiązania zadań pozwoliło uzyskać średni wyniki niemal 80 punktów w skali 1-100 przy ewaluacji strict mode, czyli w rygorystycznej ocenie binarnej (poprawne albo niepoprawne). Autorzy benchmarku zwracają uwagę na przepaść wydajnościową (performance gap) między takimi modelami a modelami open source i mniejszymi modelami dedykowanymi do konkretnych zadań (ASR, OCR, HTR). W złożonych zadaniach i także dla polskiego kontekstu kulturowego największe i najdroższe w produkcji modele radzą sobie zdecydowanie lepiej niż mniejsze alternatywy, nawet te dostrojone do polskiego kontekstu.

W benchmarku nie zabrakło rozwijanych w Polsce modeli. Testowano NASK-PIB/LLaVA-Bielik-11b-v2.6-instruct i NASK-PIB/LLaVA-PLLuM-12b-nc-instruct, jednak nie uwzględniono ich w głównym zestawieniu, ponieważ nie obsługiwały one wszystkich kategorii zadań - oba nie nadają się do przetwarzania treści audio. Dlatego przetestowano je wyłącznie w kategorii zadań wizualnych, gdzie uzyskały wyniki niższe niż 10 punktów - najbardziej efektywny w tej kategorii model Gemini-3.7-Flash uzyskał 84 punkty (punkty według ewaluacji strict mode). Ranking ten jest też dostępny na stronie benchmarku - trzeba tylko przełączyć zakładkę Vision only.

Kategorią zadań, z którymi modele - nawet te największe - radziły sobie najgorzej, była praca z dźwiękami niebędącymi mową (z muzyką i dźwiękami otoczenia). Najlepszy wynik znów osiągnięto tu z wykorzystaniem Gemini-3.1-Pro, ale było to już tylko 56 punktów.

Udział w wyścigu albo specjalizacja

Jak czytamy w opracowaniu,

postępu w multimodalnej AI nie można wiarygodnie oceniać wyłącznie na podstawie benchmarków skoncentrowanych na języku angielskim lub ograniczonych do tekstu. Język lokalny, osadzenie kulturowe oraz realistyczne dane dokumentowe i audio ujawniają ograniczenia, które w innych warunkach łatwo przeoczyć.

Duże modele multimodalne, z których korzystamy na co dzień w popularnych aplikacjach, wykazują stronniczość wobec kultury anglosaskiej i wyczuwalną - warto zwrócić na to uwagę! - generyczność. Polska historia, kultura, tradycja czy zwykłe zadania życia codziennego mogą być świetnym narzędziem do wykazywania tych ograniczeń. Najlepsze modele pewnie stosunkowo dobrze radzą sobie ze skomplikowanymi zadaniami o generycznej treści, ale ich efektywność spada, kiedy kontekst zadania zmienia się na bardziej regionalny czy niszowy, lub kiedy treścią zadania jest muzyka i dźwięki otoczenia.

Polskie modele VLM okazały się słabe w zadaniach, które wymagały połączenia efektywności technicznej (OCR, strukturyzacja odpowiedzi itp.) ze sprawnym przetwarzaniem artefaktów z polskiego kontekstu kulturowego. Okazuje się, że samo dostrojenie modelu do tego kontekstu zdecydowanie nie wystarcza. W takiej sytuacji mamy - być może - trzy rozwiązania (to już moje rozwinięcie).

Możemy próbować wpływać na rozwój dużych modeli komercyjnych przez udostępnianie coraz lepszych i coraz bardziej jakościowych danych, oddających polski kontekst kulturowy, do wykorzystania w treningach modeli (czy można nazwać to patriotyzmem danych?). Jednak - jak zresztą piszą autorzy benchmarku - wydawcom dużych modeli wcale nie zależy na lepszym uchwyceniu niszowego kontekstu kulturowego, tylko zwiększeniu efektywności ich pracy. W tym celu i tak organizują sobie samodzielnie potrzebne im zasoby, więc takie podejście nie ma sensu.

Możemy samodzielnie budować własne modele multimodalne, wiedząc, że bez radykalnie wyższych nakładów nie da się otrzymać modelu klasy frontier - narzędzia zbliżone do tej klasy można wypracowywać w ramach współpracy międzynarodowej. Latam-GPT, nowy niezależny model dla regionu i kultury Ameryki Południowej, zbudowany na bazie Llamy (od Mety), jest rozwijany przez 20 krajów i ma 70 mld parametrów, ale i tak mocno kontrastuje z możliwościami komercyjnych, zamkniętych GPT najnowszych wersji. LLaVA-Bielik ma 11 mld parametrów.

Możemy też zignorować wyścig o największe modele i budować mniejsze, ale dostosowane do konkretnych zadań i do polskiego kontekstu: modele dla administracji, rozpoznawania pisma ręcznego, systemów kontroli ekologicznej, transkrypcji historii mówionej, pomocy seniorom, wsparcia w procesach oceny jakości produktów w fabrykach. W dyskusji o sztucznej inteligencji nadaje się jej często zbyt głębokie znaczenie: ma być dowodem na zaawansowanie technologiczne kraju, przestrzenią promocji jego kultury, czymś w rodzaju narodowego zasobu naturalnego. W takim przypadku praca nad nią urasta do rangi misji, a cele stają się emocjonalne.

Autor: redakcja

🤗
Jeśli ten wpis okazał się dla Ciebie wartościowy, możesz dorzucić się do wsparcia bloga. Postaw wirtualną kawę na Suppi.pl albo zostań patronem na Patronite.

Wpis opublikowany na licencji Creative Commons Uznanie autorstwa - Na tych samych warunkach.
📬 Subskrybuj newsletter, żeby nie przegapić nowych wpisów. Możesz też skorzystać z kanałów RSS.