Porównanie

GPT-5.6 vs Claude Fable 5: co naprawdę mówią benchmarki

Jeden ranking daje przewagę Anthropic, drugi OpenAI. Zestawiamy liczby po premierze i pokazujemy, którą z nich w ogóle da się potwierdzić.

Redakcja NeuriseRedakcja Neurise 6 min czytania 17 czerwca 2026 aktualizacja: 9 września 2026

Na SWE-Bench Pro Claude Fable 5 wyprzedzał GPT-5.5 o ponad dwadzieścia punktów procentowych. Po premierze GPT-5.6 z 9 lipca 2026 ten dystans wyraźnie się skurczył, ale nie zniknął. Za to na indeksie agentów kodujących Artificial Analysis nowy model OpenAI wyszedł na prowadzenie, więc odpowiedź na pytanie z tytułu zależy od tego, który ranking uznasz za swój.

W skrócie

  • Anthropic podawał dla Fable 5 wynik 80,3% na SWE-Bench Pro wobec 58,6% dla GPT-5.5. To wynik raportowany przez producenta, nie pomiar niezależny.
  • Niezależne agregatory wpisują Fable 5 na 80,0%, a najmocniejszy wariant GPT-5.6 Sol na 64,6%.
  • Luka na tym teście zmalała z ponad dwudziestu punktów procentowych do około piętnastu.
  • Na Coding Agent Index od Artificial Analysis kolejność jest odwrotna: GPT-5.6 Sol ma 80 punktów, o 2,8 przed Fable 5, zużywając mniej niż połowę tokenów wyjściowych.
  • Okno kontekstu 1,5 mln tokenów pozostaje niepotwierdzone: nie ma go ani w komunikacji OpenAI, ani w relacjach z dnia premiery.

Skąd wzięła się przewaga Fable 5

Claude Fable 5 pojawił się 9 czerwca 2026 jako pierwszy model klasy Mythos udostępniony szeroko. Anthropic opisał go wtedy jako state of the art na prawie wszystkich testowanych benchmarkach, ale w samym komunikacie firmy próżno szukać konkretnych procentów dla poszczególnych testów.

Najczęściej cytowaną liczbą stał się wynik z SWE-Bench Pro, czyli zestawu prawdziwych zgłoszeń z repozytoriów, w którym model musi sam znaleźć właściwy plik, napisać poprawkę i przejść testy. W zestawieniu Anthropic, przytoczonym między innymi przez Vellum, Fable 5 uzyskał 80,3% wobec 58,6% dla GPT-5.5 i 69,2% dla wcześniejszego Opus 4.8. Ponad dwadzieścia punktów różnicy na takim teście to nie szum pomiarowy.

Kto policzył ten wynik i dlaczego to ma znaczenie

80,3% to liczba producenta: pochodzi z zestawienia Anthropic, a nie z pomiaru powtórzonego przez kogoś z zewnątrz. Warunków, w jakich model rozwiązywał zadania, żadne z cytowanych źródeł nie opisuje.

Niezależne agregatory notują Fable 5 nieco niżej, na poziomie 80,0%. Różnica jest kosmetyczna, ale zasada nie: dopóki pomiaru nie powtórzy ktoś spoza firmy, liczba z komunikatu prasowego jest materiałem marketingowym, a nie dowodem.

Większe okno kontekstu pomaga widzieć więcej naraz. Nie mówi jednak nic o tym, co model z tym kontekstem zrobi.

Co GPT-5.6 rzeczywiście dostarczył

Premiera się przesunęła. Zamiast czerwcowego wydania OpenAI udostępniło 26 czerwca 2026 ograniczony podgląd dla wąskiej grupy partnerów, a szeroka dostępność przyszła 9 lipca 2026. Wcześniej, jak podaje TechCrunch, administracja USA dążyła do ograniczenia wdrożenia modelu w obawie przed jego nadużyciem. Podobny mechanizm dotknął wcześniej modele Anthropic, o czym pisaliśmy przy okazji rządowej blokady Fable 5 i Mythos 5.

Rodzina ma trzy warianty: Luna (najtańszy), Terra (pośredni) i Sol (najmocniejszy). Po premierze na SWE-Bench Pro Sol notuje 64,6%, Terra 63,4%, a Luna 62,7%. Na Coding Agent Index prowadzonym przez Artificial Analysis Sol ustanowił nowy rekord z wynikiem 80 punktów, o 2,8 nad Fable 5, i zrobił to zużywając mniej niż połowę tokenów wyjściowych. OpenAI podaje przy tym 54% wyższą efektywność tokenową w zadaniach kodowania.

Domknięcie luki, nie skasowanie

Zestawmy to uczciwie. Na SWE-Bench Pro odstęp między liderem a najmocniejszym modelem OpenAI zmalał z ponad dwudziestu punktów procentowych do około piętnastu. To realny postęp w jednym wydaniu, ale nadal przegrana w tej konkretnej konkurencji. Na Coding Agent Index układ jest odwrotny i to Sol jest z przodu. Na Intelligence Index tego samego Artificial Analysis, mierzonym na początku września, wersja Fable 5.1 zebrała 66 punktów wobec 61 dla GPT-5.6 Sol.

Wniosek jest niewygodny dla nagłówków: nie ma jednego zwycięzcy, jest zwycięzca per benchmark. Pytanie „który model jest lepszy” zadane bez dopowiedzenia nie ma poprawnej odpowiedzi. Sensowna wersja brzmi: lepszy w czym, przy jakim budżecie i w jakiej konfiguracji.

Druga strona medalu: czego nie wiemy

Okno kontekstu 1,5 mln tokenów, które przed premierą trafiło do wielu zapowiedzi, nie pojawia się ani w materiałach OpenAI, ani w relacjach z dnia premiery. Dopóki nie trafi do dokumentacji, jest liczbą niepotwierdzoną i tak należy ją traktować. Zresztą sama pojemność okna mówi mniej, niż się wydaje: modele potrafią gubić szczegóły ze środka bardzo długiego dokumentu, o czym pisaliśmy w tekście o tym, jak AI gubi się w długim tekście.

Druga niewiadoma dotyczy jakości samego zbioru zadań. BenchLM odnotowuje, że audyt OpenAI z lipca 2026 uznał około 30% publicznych zadań tego benchmarku za wadliwe i wycofał wcześniejszą rekomendację jego stosowania, więc wynik wymaga sprawdzenia konfiguracji i doboru zadań, zanim posłuży za podstawę decyzji zakupowej. Trzecia rzecz jest najprostsza: wszystkie te testy mierzą pracę inżynierską w repozytoriach open source. Twoje zadania to najprawdopodobniej coś zupełnie innego.

Co z tego dla właściciela małej firmy

Jeśli nie budujesz własnego produktu opartego na modelu, żadna z powyższych liczb nie powinna sama decydować o wyborze narzędzia. Praktyczne konsekwencje są trzy.

Koszt. Liczy się nie cena za milion tokenów, tylko ile tokenów model zużyje na Twoje zadanie. Model droższy w cenniku, ale kończący pracę w połowie kroków, wychodzi taniej w rachunku miesięcznym. Dokładnie o tym jest podejście, które opisaliśmy jako tokenmaxxing.

Zastosowanie. Modele rozjeżdżają się mocniej w zadaniach agentowych, czyli wieloetapowych, z narzędziami i długimi sesjami, niż w prostym pisaniu tekstu. Jeśli Twoje użycie to opisy produktów, streszczenia i odpowiedzi na maile, różnica między czołówką rankingu a modelem klasę niżej będzie dla Ciebie niewidoczna, a różnica w rachunku bardzo widoczna.

Widoczność. To, którego modelu używasz wewnętrznie, nie ma żadnego związku z tym, czy asystenci AI polecają Twoją firmę klientom. To osobna robota, opisana szerzej w tekście o tym, co Claude Fable 5 zmienia w SEO i GEO.

Jak sprawdzić to u siebie w tydzień

Zamiast ufać cudzym tabelom, zrób własny mikrotest. Wystarczy tydzień i arkusz.

  1. Wypisz pięć zadań, które naprawdę zlecasz AI w firmie. Te powtarzalne, nie te z demo.
  2. Uruchom każde na dwóch modelach z różnych rodzin, przy identycznie sformułowanym poleceniu.
  3. Dla każdego przebiegu zapisz trzy rzeczy: czy wynik nadaje się do użycia bez poprawek, ile minut zajęła poprawka, ile kosztowało wywołanie.
  4. Po pięciu zadaniach masz własny ranking. Będzie się różnił od każdego publicznego i o to chodzi, bo mierzy Twój przypadek.
  5. Powtórz po każdej większej premierze. Czołówka przestawia się co kilka tygodni, czego dowodem jest to, że do gry weszły już Fable 5.1 i ChatGPT Astra, zanim ten spór zdążył się rozstrzygnąć.

Kontekst obu rodzin modeli opisaliśmy osobno: premierę Claude Fable 5 i Mythos 5 wraz z blokadą dystrybucji oraz co Fable 5.1 i Astra znaczą dla SEO, GEO i AEO.

Najczęstsze pytania

Zależy od benchmarku. Na SWE-Bench Pro Claude Fable 5 trzyma okolice 80 procent wobec 64,6 procent dla GPT-5.6 Sol. Na Coding Agent Index prowadzonym przez Artificial Analysis układ jest odwrotny: Sol ma 80 punktów, o 2,8 przed Fable 5.

Częściowo. Na SWE-Bench Pro luka zmalała z ponad dwudziestu punktów procentowych do około piętnastu, a na indeksie agentów kodujących GPT-5.6 Sol wyszedł na prowadzenie. Wyprzedzenia we wszystkich testach naraz nie ma.

Ta liczba pochodzi z zapowiedzi sprzed premiery i nie została potwierdzona ani w komunikacji OpenAI, ani w relacjach z dnia premiery 9 lipca 2026. Do czasu potwierdzenia traktuj ją jako niepewną.

Nie kierować się rankingiem. Wypisz pięć zadań, które naprawdę zlecasz AI, uruchom je na dwóch modelach przy tym samym poleceniu i zapisz trzy rzeczy: czy wynik nadaje się do użycia bez poprawek, ile trwała poprawka i ile kosztowało wywołanie.

Źródła: Anthropic, premiera Claude Fable 5 i Mythos 5 (9.06.2026), Vellum, zestawienie benchmarków Fable 5 (80,3% i 58,6% na SWE-Bench Pro, 69,2% dla Opus 4.8), llm-stats, tabela SWE-Bench Pro (80,0% Fable 5, 64,6% GPT-5.6 Sol, 58,6% GPT-5.5), BenchLM, tabela SWE-Bench Pro i zastrzeżenie o jakości zadań (8.09.2026), TechCrunch, premiera GPT-5.6 Sol, Terra i Luna oraz wynik 80 na Coding Agent Index (9.07.2026), heise online, Intelligence Index 66 dla Fable 5.1 wobec 61 dla GPT-5.6 Sol (2.09.2026).

Redakcja Neurise
Redakcja NeuriseSEO & GEO oparte na AI
← Wszystkie wpisy

Sprawdź, czy AI poleca Twoją firmę.

Zacznij od bezpłatnego audytu SEO i GEO. Sprawdzimy, jak modele AI opisują Twoją markę, i wskażemy priorytety zwiększające szanse na cytowanie.

Bezpłatnie · bez zobowiązań

Odbierz darmowy audyt AI

Zostaw dane i adres swojej strony, a sprawdzimy, jak radzi sobie w Google i czy pojawia się w odpowiedziach AI. Wynik dostajesz z konkretnymi rekomendacjami.

Administratorem danych jest NEURISE sp. z o.o. z siedzibą w Kutnie. Dane z formularza przetwarzamy wyłącznie po to, aby przygotować audyt i odpowiedzieć na zgłoszenie (art. 6 ust. 1 lit. b i f RODO). Masz prawo dostępu do danych, ich sprostowania, usunięcia i sprzeciwu. Szczegóły w polityce prywatności.