P0Wkrótce — ChatGPT, Claude, Gemini, GPT-5, Llama
Wkrótce

Detektor AI: sygnał, nie wyrok

Wykrywanie AI pojawi się wkrótce — jest na naszej roadmapie, jeszcze nie jest dostępne. Po wdrożeniu każdy detektor AI — w tym nasz — czasami się myli. Noplag zwróci skalibrowany wynik prawdopodobieństwa, nie wyrok tak/nie, i opublikuje wskaźnik fałszywie pozytywnych dla osób piszących po angielsku jako drugim języku. Budujemy pokrycie dla ChatGPT, Claude, Gemini, GPT-5 i Llama. Sprawdź, co oznacza wynik przed podjęciem decyzji — szczególnie przy ocenie studentów i kandydatów do pracy. Detekcja to jeden sygnał z wielu. Nie powinna być jedynym.

0 / 1,500 words
Dane kalibracyjne opublikowaneZabezpieczenia ESL-biasPięć rodzin modeli
WYKRYWANIE WG MODELU

Sygnatury detekcji dla każdego głównego LLM.

Każdy model zostawia inny ślad statystyczny. Śledzimy je osobno dla każdej wersji; publikujemy dane kalibracji dla modeli, aby było jasne, co oznacza wynik.

OpenAI

ChatGPT

Rodziny gpt-4o, o1, o3. Śledzimy dryf wyjść między wydaniami; kalibracja trenowana ponownie do 30 dni po każdej premierze. Raport wskazuje rodzinę, z którą wynik jest najbardziej zgodny.

Anthropic

Claude

Sonnet, Opus, Haiku w wersjach 3.x i 4.x. Sygnał detekcji zależny od trybu (tryb myślący vs. szybki); kalibracja przypisana do trybu w każdym raporcie.

Google

Gemini

1.5 Pro, 2.0 Flash, 2.5 Pro. Wielojęzyczny sygnał słabszy dla nie-angielskich tekstów; raport zaznacza to jako 'niskie zaufanie zasobowe' zamiast ukrywać.

OpenAI

GPT-5

Wydanie OpenAI z sierpnia 2025. Ślad behawioralny inny niż gpt-4o; trenujemy ponownie na przykładowych wyjściach z karty modelu w 30 dni od premiery.

Meta (open-weight)

Llama

Rodziny 3, 3.1, 3.3. Warianty self-hosted są trudniejsze — finetuning zmienia sygnaturę. Raport wskazuje 'prawdopodobnie LLM, rodzina Llama', bez wersji.

ESL WRITER BIAS

Każdy detektor AI nadmiernie oznacza piszących w języku angielskim jako drugim. Oto, co robimy z tym problemem.

Liang i wsp. (Stanford, 2023) zmierzyli 61% fałszywie pozytywnych na esejach TOEFL — sześciokrotnie więcej niż dla native speakerów. Każdy detektor. Nasz także, zanim skorygowaliśmy.

Publikacja ze Stanfordu

Liang i wsp. (2023) przetestowali każdy komercyjny detektor AI na esejach TOEFL osób niebędących native speakerami. Detektor referencyjny oznaczył 61% jako AI — sześć razy częściej niż przy rodzimych użytkownikach. Te same teksty, to samo zadanie.

Co skalibrowaliśmy

Ponownie przetrenowaliśmy klasyfikator po usunięciu cech ESL — równa długość zdań, prostszy słownik, mniej idiomów nie są traktowane jako sygnały AI. Liczą się tylko cechy niezależne od stylu. Wnioskujemy ze struktury, nie z językowego wykończenia.

Pozostały poziom błędu

Po poprawce: udokumentowany, osobny dla każdego języka przedział ufności zamiast jednej ogólnej wartości. Tabele dla poszczególnych języków publikujemy po zakończeniu ewaluacji funkcji — dokładnie to, czego wymaga audyt instytucjonalny.

Kiedy nie ufać

Przy ocenie ESL i wyniku w zakresie 20–80% traktować go tylko orientacyjnie. Komunikat 'niska pewność — ostrożna interpretacja' pokazujemy w raporcie.

Co nadal chybimy

Teksty hybrydowe — szkic LLM, redakcja native'a — są trudniejsze niż oba przypadki osobno. Raport wskazuje 'sygnał mieszany, prawdopodobnie hybryda', bez zgadywania; część pozostałych błędów tu występuje.

Na czym mierzymy

Publiczne zbiory esejów TOEFL, prace akademickie z krajów hiszpańskojęzycznych, oraz wielojęzyczne teksty oceniane według CEFR. Te same dane, których używali Liang i in., plus 8 nowych korpusów zebranych w latach 2024-2026. Odniesienia publikujemy razem z metodologią po wdrożeniu funkcji.

CO ZNACZY WYNIK

Prawdopodobieństwo, nie wyrok.

Wynik to prawdopodobieństwo między 0% a 100%. Powyżej 80%: duże prawdopodobieństwo wygenerowania przez AI. Poniżej 20%: duże prawdopodobieństwo tekstu ludzkiego. Zakres 20–80% traktować jako jeden z wielu sygnałów, nie jako dowód. Stosuj detekcję do rozpoczęcia rozmowy, nigdy do zamykania sprawy.

0–20%
PRAWDOPODOBNIE LUDZKI TEKST

Wysokie prawdopodobieństwo, że tekst napisał człowiek. Wskaźnik fałszywie pozytywnych wyników dla tego zakresu publikujemy osobno dla każdego języka po zakończeniu ewaluacji funkcji.

20–80%
NIEJEDNOZNACZNE — WYŚLEDŹ

Model nie jest pewny. Traktuj wynik jako jeden z wielu — próbki wcześniejsze, robocze, praca na lekcji. Nie podejmuj decyzji tylko na tej podstawie.

80–100%
PRAWDOPODOBNIE LLM

Duże prawdopodobieństwo, że tekst wygenerowany przez duży model językowy. To wciąż nie wyrok. Włącz kontekst (prompty, historię przeglądania, obronę ustną) przed decyzją.

Każdy zakres wyników zawiera opublikowany margines błędu, osobno dla każdego języka, po zakończeniu ewaluacji funkcji.
  • 5Rodziny LLM objęte na starcie
  • 61%Stanford 2023: fałszywie pozytywne ESL
  • 30dplanowana częstotliwość ponownego trenowania po każdej publikacji modelu
  • v1.2planowany termin wdrożenia wykrywania AI
  • 2024początek rozwoju detekcji
DLACZEGO NIE HUMANIZER

Staramy się o przejrzystość. Nie dostarczamy narzędzia do oszukiwania detektora.

Humanizer to narzędzie do obchodzenia wykrywania AI — przepisuje tekst LLM, by obniżyć wynik detekcji. Moglibyśmy je stworzyć. Nie robimy tego. Naszym celem jest ujawnianie użycia AI, nie ukrywanie. Jeśli detekcja ma być cenna, dostawca detektora i humanizera nie może być ten sam. Stanowisko mamy jasno określone. Wspominamy o humanizerach, by ostrzegać, że mogą być użyte przed kontrolą tekstu — nie po to by je promować.

Przeczytaj pełne stanowisko
KONTRA SAMODZIELNE DETEKTORY AI

Jak wypadamy vs. GPTZero, Originality.ai i Winston.

GPTZERO

Skupiony na edukacji, bez warstwy plagiatu, niejawna kalibracja. Tylko detekcja AI; chcesz plagiat w jednym raporcie — musisz użyć dwóch narzędzi.

Wykrywanie + plagiat + silnik open source. Dane kalibracyjne dla każdego modelu są publikowane. Ten sam raport, ten sam dostawca, pełna możliwość audytu.

ORIGINALITY.AI

Marketing '97% skuteczność'. Brak jawnej stopy fałszywie pozytywnych. Kalibracja tylko dla angielskiego. Zamknięty kod — nie jesteś w stanie prześledzić jak uzyskano wynik.

Rzetelna informacja o uprzedzeniach względem osób uczących się języka (wskazujemy wprost Liang 2023). Kalibracja dla wielu języków. Silnik open source; metodologia publikowana razem z funkcją.

WINSTON

Mocny na ChatGPT. Słabszy sygnał na Claude i Gemini. Wysoka cena przy dużych wolumenach; próg cenowy powyżej 10 tys. słów/mc.

Pokrycie każdej dużej rodziny modeli, ta sama kalibracja. Progi cenowe stałe do pro-planu. Opcja self-host dla klientów z ograniczeniami zgodności.

NAJCZĘŚCIEJ PYTANE

Dwanaście pytań, szczere odpowiedzi.

Jeżeli nie znamy odpowiedzi, napisane jest wprost. Listę aktualizujemy przy zmianach w kalibracji.

Czy detekcja AI jest dokładna?
Rzetelnie: żaden detektor nie jest wiarygodny dla tekstów krótszych niż ok. 200 słów, a każdy detektor ma wskaźniki fałszywie pozytywnych wyników zależne od stylu pisania, języka i użytego LLM. Noplag zobowiązuje się publikować dane kalibracyjne, abyś wiedział, co oznacza „dokładność” w Twoim przypadku; dane publikujemy razem z funkcją.
Czy Noplag oznaczy moją angielszczyznę jako AI?
Może tak być — jesteśmy w tym szczerzy. Liang i wsp. (Stanford 2023) pokazali, że każdy komercyjny detektor AI nadmiernie oznacza piszących po angielsku jako drugim. Nasze zabezpieczenia obniżają fałszywe pozytywy dla znanych wzorców ESL, wskaźnik resztkowy publikujemy. Jeśli wynik niepewny, jest to wyraźnie opisane w raporcie.
Jakie modele AI wykrywa Noplag?
Na start detekcja pokryje: ChatGPT (gpt-4o, o1, o3), Claude (Sonnet / Opus / Haiku, 3.x i 4.x), Gemini (1.5 / 2.0 / 2.5), GPT-5 oraz Llama 3.x. Detekcja wkrótce; jakość różna w zależności od modelu, raport poda sygnaturę, z którą wynik jest zgodny.
Czym się różni od GPTZero lub Originality.ai?
Łączymy wykrywanie AI z kontrolą plagiatów i udostępniamy silnik na licencji open source. GPTZero służy wyłącznie do wykrywania. Originality.ai to rozwiązanie zamknięte, bez ujawnionych danych o biasie wobec osób uczących się angielskiego. Porównania linia po linii znajdziesz w /vs-gptzero i /vs-originality-ai.
Czy uczniowie mogą obejść ten detektor humanizerem?
Tak — humanizery istnieją i nie mamy co tego ukrywać. Silna redakcja po AI osłabia sygnał detekcji. Nie dostarczamy humanizera (to sprzeczne z naszą misją). Detekcję AI traktuj jako jeden z sygnałów, nie wyrok.
Co oznacza 'fałszywie pozytywny' tutaj?
Tekst napisany przez człowieka oceniony jako wygenerowany przez AI. Będziemy mierzyć i publikować ten wskaźnik osobno dla każdego języka i grupy stylów pisania. W żadnym detektorze nie wynosi on zera — traktowanie wysokiego wyniku jako dowodu zamiast sygnału do dalszej analizy to nadużycie, przed którym ostrzegamy na tej stronie.
Czy oferujecie 'detekcję z dokładnością 99%'?
Nie. Każdy, kto twierdzi, że utrzymuje powyżej ~85% dokładności dla różnych stylów, języków i LLM, podaje nieprawdziwe informacje o możliwościach matematycznych. Publikujemy rzeczywisty przedział ufności dla każdego języka po zakończeniu ewaluacji funkcji. Nie sprzedajemy pewności.
Czy detekcja AI jest darmowa?
Detekcja AI rusza wkrótce. W chwili startu darmowa na bezpłatnym progu — ten sam limit 2 500 słów co antyplagiat. Płatne progi podnoszą limity; detekcja AI nie będzie nigdy zamknięta za osobną płatną funkcjonalnością.
Jak aktualny jest zasięg modeli?
Trenujemy detekcję na nowych modelach LLM do 30 dni po premierze. Jeśli jakiś model nie pojawił się jeszcze w zbiorze kalibracyjnym, raport poda 'prawdopodobnie LLM, model nieznany' zamiast zgadywać rodzinę.
Czy obsługujecie wielojęzyczną detekcję AI?
Angielski, hiszpański, francuski, niemiecki i portugalski mają walidowane kalibracje — najsilniejszy sygnał angielski. Inne języki z wynikiem oznaczonym 'niskie zasoby — interpretuj szczególnie ostrożnie'. Raport wskazuje poziom kalibracji dla wskazanego języka.
Czy mogę zintegrować detekcję AI przez API?
Wkrótce. Detekcja AI jest na roadmapie; po wdrożeniu, endpoint /v1/checks zwróci oceny plagiatu i AI. Szczegóły w /plagiarism-checker-api oraz /docs/api.
Co zrobić jeśli nie zgadzam się z wynikiem?
Napisz nam. Logujemy poprawki, trenujemy ponownie do 30 dni po aktualizacji modelu, publikujemy różnice zachowania między wersjami. Detekcja nie jest perfekcyjna; wolimy wiedzieć, gdy jest błąd, niż udawać, że nie występuje.

Detekcja AI — już wkrótce, darmowa do 2 500 słów.

Dane kalibracyjne, wskaźniki fałszywie pozytywnych i sygnatury modeli będą jawne. Zobacz co stoi za wynikiem zanim podejmiesz decyzję.

Powiadom mnie, kiedy ruszy
Detektor AI: ChatGPT, Claude, Gemini, GPT-5