Uruchomienie bloga zostało sfinansowane przez społeczność ❤️
Mecenasem bloga jest Fundacja Zakłady Kórnickie,
wydawca portalu historycznego Hrabia Tytus

Jak bez Pangrama rozpoznać tekst akademicki wygenerowany przez AI?

Jak bez Pangrama rozpoznać tekst akademicki wygenerowany przez AI?

Czy da się rozpoznać tekst wygenerowany przez AI bez korzystania z detektora? Być może czasem wystarczy uważnie przeczytać pracę i dobrze znać wykorzystane w niej źródła. Analiza przypisów, rozpoznanie nieporadnych tłumaczeń i wykrycie oraz zbadanie konstrukcji parafraz może dostarczyć więcej informacji niż automatyczna detekcja, z którą - jak się okazuje - wciąż są duże problemy.

W poprzednim roku akademickim miałem wątpliwą przyjemność czytać pracę zaliczeniową (z kierunku cyfrowo-humanistycznego), która okazała się wytworem modeli językowych. Osoba, która miała ją przygotować, dostała ode mnie dwa artykuły naukowe jako podstawowe wprowadzenie do tematu i inspirację do wyszukiwania kolejnych źródeł. Niestety, nie zostały one dobrze wykorzystane i w efekcie przysłany mi materiał nie mógł być podstawą zaliczenia.

Rozpoznanie tego, że praca nie była samodzielna, okazało się w tym przypadku bardzo łatwe. Nie korzystałem przy tym z żadnego detektora, wystarczyło znać źródłowe lektury i wczytać się w tekst przysłany na zaliczenie. Bardzo wiele pisze się o tym, w jaki sposób modele językowe ujawniają się w tekście - tą notką chciałbym dołożyć do tego kilka swoich obserwacji, a na końcu przytoczyć ważne opracowanie dotyczące aktualnego statusu metod maszynowych rozpoznawania “AI” w tekstach. Jeśli nie chcecie czytać o mojej pracy z akademickim slopem i z początkiem roku akademickiego wciąż pokładacie nadzieję w Pangramie, możecie od razu przejść do ostatniej części tego wpisu.

Rozpoznawanie AI: co warto sprawdzić

  1. Kontekst napisania pracy: zanim w ogóle zerknąłem do przesłanej mi pracy zaliczeniowej, miałem już pewne przypuszczenia co do tego, jakiej jakości ona będzie. Być może to niesprawiedliwe podejście, ale nie sądzę, żeby nieuczciwi studenci i studentki mieli jakiekolwiek opory. Nie chodzi też przecież o wyrzucanie pracy do kosza jeszcze przed lekturą, ale coś w rodzaju negatywnego przeczucia: skoro autor czy autorka nie pojawiała się na zajęciach albo na nich nie pracowała, naiwnością byłoby oczekiwać świetnej pracy zaliczeniowej. Wspaniale byłoby, gdyby tekst okazał się świetny, ale nie ma sensu na to liczyć. Jeśli student albo studentka niewiele pracuje przed napisaniem pracy, może to być sygnał, że z przysłanym na zaliczenie tekstem będą problemy. A ponieważ najłatwiej i najszybciej da się napisać obszerną pracę zaliczeniową, korzystając z darmowych narzędzi “sztucznej inteligencji”, możemy zakładać, że zostaną one wykorzystane.

  2. Sieć przypisów: praca, z którą musiałem pracować, wykorzystywała przede wszystkim zaproponowane przeze mnie dwa podstawowe teksty. Dodatkowo wykorzystano artykuły naukowe i opracowania z rozmaitych witryn, ale wyłącznie te, które cytowali autorzy i autorki źródłowych opracowań. To fajny paradoks, że ograniczona bibliografia ułatwia ręczne rozpoznawanie nieuczciwego wykorzystania “AI” w pracy. Sieć przypisów da się łatwo sprawdzić samodzielnie, dodatkowo skorzystać można z Gemini Notebook, wrzucając do osobnego notatnika podejrzaną pracę zaliczeniową i wszystkie wykorzystane w niej lektury. Być może to też jakaś wskazówka do planowania zaliczeń pisemnych - jeśli z jakiegoś powodu wciąż chcemy je robić, można projektować je tak, aby bazowały na głębokim zrozumieniu kilku kluczowych lektur. Analiza takiej pracy będzie łatwiejsza niż przeglądanie dziesiątek opracowań wskazanych studentowi czy studentce przez wyszukiwarkę w ChatGPT.

  3. Nieporadne tłumaczenia specjalistycznych pojęć: to już trzeci punkt mojej listy, a wciąż nie zajęliśmy się językiem, jakim napisana została badana praca. Zejdźmy więc teraz na ten poziom, nie szukajmy jednak proponowanych w popularnych opracowaniach sygnałów maszynowo generowanej narracji. Zaproponowane przeze mnie artykuły napisane były w języku angielskim, a osoba, która przygotowała pracę zaliczeniową, nie zdecydowała się przytaczać cytatów w oryginale, tylko tłumaczyć je na język polski. Oba te artykuły, ale też artykuły w nich cytowane, zawierały wiele specyficznych pojęć, które trudno znaleźć w ogólnych słownikach - wystarczyło uważnie przeczytać pracę i wyłapać oczywiste sygnały maszynowego tłumaczenia. Tłumaczenie takie pozbawione jest przecież korekty merytorycznej, która musiałaby wynikać z przeczytanych samodzielnie przez studenta czy studentkę lektur i bazować na zrozumieniu przywoływanych w źródłach pojęć. Nieraz fakt maszynowego tłumaczenia zdradzał też szyk zdań, nieporadne kalki z angielskiego, niepasujące do siebie zdania i sztuczność, którą bardzo łatwo wyłapać. Bezpośrednim dowodem były tu jednak przede wszystkim nieporadne kalki pojęć informatycznych czy tych z badań społecznych. Kiedy - tu przykład spoza pracy - czytamy o darmowych licencjach, a w opracowaniach użyte jest free licences, doskonale wiemy, że ktoś tu nie odrobił podstawowych lekcji.

  4. Parafraza: parafraza to mechanizm na poziomie języka, więc pozostańmy w tej warstwie analizy: osoba, która przygotowała pracę, parafrazowała maszynowo dwa podstawowe teksty źródłowe. Cytowała niewielkie fragmenty, a następnie parafrazowała całą resztę. Dlaczego sądzę, że parafrazowanie również zostało wykonane maszynowo? Oto pojawiały się tam źle przetłumaczone i źle rozumiane pojęcia. Dodatkowo, co było dość ciekawą obserwacją, parafrazy były dość poszarpane, tak jakby nieuczciwy autor czy autorka pisał prompt, wklejał odpowiedź modelu, następnie pisał kolejny i kolejną odpowiedź wklejał, itd. Efektem tego były całe akapity tekstu, w których w pewnym miejscu radykalnie zmieniał się temat, albo ginęła jakaś myśl, zasygnalizowana w pierwszych zdaniach. Być może w analizie tekstów podejrzewanych o maszynową ingerencję warto zwracać szczególną uwagę na parafrazę, ponieważ to podstawowa metoda oszukiwania detektorów.

  5. Treść przypisów: wartościowe może być też spojrzenie na treść przypisów. W pracy, którą musiałem zbadać, dała mi ona bardzo użyteczne informacje. O zamkniętej sieci przypisów wspominałem już wyżej, w tym miejscu analizy warto podejść do nich bardziej jakościowo. Czy te przypisy coś wnosiły do pracy? Czy nie były tylko zapełniaczami, które miały ją unaukowić? Przypis, który miał sens w pracy źródłowej, nie musi mieć sensu w jej opracowaniu, prawda? Warto pamiętać też o potencjale znaczników utm_source 🙂.

  6. Konstrukcja i tropy językowe: na koniec pozostaje nam analiza struktury pracy i tropy językowe “AI”. Rozważmy taki fragment (to przykład spoza omawianego tekstu) w tekście naukowym:

Digitalizacja jest ważnym elementem działalności instytucji dziedzictwa, ponieważ umożliwia zachowanie, opracowanie oraz szerokie udostępnianie zasobów kulturowych. Proces ten polega na przekształcaniu materiałów analogowych, takich jak dokumenty, fotografie, rękopisy, dzieła sztuki czy obiekty muzealne, do postaci cyfrowej. Dzięki temu cenne i często unikatowe zbiory mogą być chronione przed zniszczeniem wynikającym z upływu czasu, niewłaściwych warunków przechowywania lub intensywnego użytkowania.

Ech, taki styl pisania Orwell określał jako pretensjonalny (pretentious diction): jego cechą jest nagromadzenie ogólnych faktów i oczywistości, uczony, nawet napuszony język i brak konkretów. Zobaczmy, że w tym krótkim fragmencie nie tylko dostajemy panoramę digitalizacji, ale też niczego nowego się nie dowiadujemy. Dodatkowo tekst przekonuje nas, że zbiory archiwów i muzeów zawsze muszą być cenne i unikatowe (niepotrzebne wartościowanie). Jeśli miałoby być to otwarcie tekstu, to jest zbyt długie i banalne, a jeśli element merytorycznego akapitu, to jest on zupełnie pozbawiony wartości poznawczej. Pamiętajmy, że ocenie podlega tu tekst akademicki, a nie content pod SEO.

Łatwość wykrywania pretensjonalnego stylu w tekstach maszynowych może zainspirować nas do takiego projektowania pisemnych prac zaliczeniowych (jeśli już musimy je projektować), żeby były jak najbardziej specjalistyczne, niszowe, korzystające z oryginalnych, unikalnych i trudno dostępnych (czyli poza internetem) źródeł. Przy takich zadaniach modele językowe wytwarzać będą akademickie SEO, a my będziemy mogli jednoznacznie ujawnić, że coś jest tu bardzo, ale to bardzo nie tak.

Pangram i GPTZero

No dobrze, ale co jeśli wciąż chcielibyśmy maszynowo analizować takie pisanie z “AI”? Werdykt maszyny może wydawać się obiektywny, ale naprawdę, w 2026 roku nie powinno już się wierzyć w takie rzeczy. Wspomina o tym opracowanie AI-detection tools have made huge leaps forward — how good are they? pomieszczone w “Nature” (DOI: 10.1038/d41586-026-02569-3, 2026), więc raczej godne zaufania.

Korzystanie z Pangrama albo GPTZero może wydawać się skutecznym rozwiązaniem kwestii plagiatów AI. Niestety, jak czytamy, detektory

nadal czasami się mylą, dlatego narzędzia te można wykorzystywać jedynie jako punkt wyjścia do dalszego badania - ich wyniki są mniej miarodajne w przypadku tekstów redagowanych przy pomocy AI, w których treść napisana przez człowieka miesza się z tekstem wygenerowanym przez AI, nie ma też wyraźnej granicy określającej, kiedy takie wykorzystanie staje się problematyczne.

Narzędzia te nie działają już w oparciu o wyszukiwanie kilku z góry określonych cech tekstu, ale wykorzystują modele uczenia maszynowego. Przykładowo, Pangram został wytrenowany na milionach ludzkich tekstów oraz ich lustrzanych wersji wygenerowanych przez LLM-y, więc detekcja wykonywana jest na podstawie bardzo subtelnych cech, niestety nie zawsze łatwo rozpoznawalnych i opisywalnych przez człowieka. Najnowsze testy pokazują, że Pangram utrzymuje odsetek wyników fałszywie pozytywnych na poziomie 0.0041 proc. dla tekstów w języku angielskim i - co ważne - analiza Pangrama nie dyskryminuje autorów, którzy nie posługują się płynnie językiem angielskim. Konsekwencją ograniczania rozpoznań fałszywie pozytywnych w Pangramie i GPTZero jest, jak czytamy, coraz większa akceptacja dla wyników fałszywie negatywnych (sytuacji, w których niektóre teksty wygenerowane przez AI zostają błędnie uznane za napisane przez człowieka). Wyniki działania tych narzędzi podatne są też wciąż na niewielkie zmiany w badanych dokumentach, które mogą czasami powodować znaczną zmianę w ostatecznym wyniku testowania (jitter). Klasyfikacja może zmieniać się też w zależności od zmian w strukturze tekstu. To wszystko sprawia, że GPTZero czy Pangram mogą być traktowane jako narzędzia przesiewowe, a nie źródło ostatecznych decyzji co do autorstwa badanych tekstów. Warto też odpowiednio czytać ich wyniki: nawet artykuł oznaczony jako wygenerowany maszynowo w 100 proc. może zawierać fragmenty ludzkiego autorstwa. Jeden z cytowanych w opracowaniu badaczy przyznaje, że

nie przywiązuje dużej wagi do dokładnych wartości procentowych podawanych przez detektory w przypadkach, kiedy AI zostało wykorzystane do pomocy przy pisaniu lub redagowania tekstu, a szczególnie nie przekonują mnie próby dowodzenia na tej podstawie, że poszczególne zdania lub krótkie fragmenty tekstu zostały napisane przez AI.

Jeśli w przygotowanych przez studentów i studentki pracach zaliczeniowych oficjalnie zaakceptujemy pewne wsparcie maszynowe, możemy wykorzystać jedną z gotowych taksonomii do wskazania, jaki zakres miała ta pomoc. Jak można wnioskować z tekstu w “Nature”, detekcja AI w tekstach wciąż nie jest na tyle skuteczna i przejrzysta, żeby można było wdrożyć ją do procedur akademickich.

Autor: redakcja

🤗
Jeśli ten wpis okazał się dla Ciebie wartościowy, możesz dorzucić się do wsparcia bloga. Postaw wirtualną kawę na Suppi.pl albo zostań patronem na Patronite.

Wpis opublikowany na licencji Creative Commons Uznanie autorstwa - Na tych samych warunkach.
📬 Subskrybuj newsletter, żeby nie przegapić nowych wpisów. Możesz też skorzystać z kanałów RSS.