GPT-5.6 vs Claude Fable 5: co naprawdę mówią benchmarki
Jeden ranking daje przewagę Anthropic, drugi OpenAI. Zestawiamy liczby po premierze i pokazujemy, którą z nich w ogóle da się potwierdzić.
Na SWE-Bench Pro Claude Fable 5 wyprzedzał GPT-5.5 o ponad dwadzieścia punktów procentowych. Po premierze GPT-5.6 z 9 lipca 2026 ten dystans wyraźnie się skurczył, ale nie zniknął. Za to na indeksie agentów kodujących Artificial Analysis nowy model OpenAI wyszedł na prowadzenie, więc odpowiedź na pytanie z tytułu zależy od tego, który ranking uznasz za swój.
W skrócie
- Anthropic podawał dla Fable 5 wynik 80,3% na SWE-Bench Pro wobec 58,6% dla GPT-5.5. To wynik raportowany przez producenta, nie pomiar niezależny.
- Niezależne agregatory wpisują Fable 5 na 80,0%, a najmocniejszy wariant GPT-5.6 Sol na 64,6%.
- Luka na tym teście zmalała z ponad dwudziestu punktów procentowych do około piętnastu.
- Na Coding Agent Index od Artificial Analysis kolejność jest odwrotna: GPT-5.6 Sol ma 80 punktów, o 2,8 przed Fable 5, zużywając mniej niż połowę tokenów wyjściowych.
- Okno kontekstu 1,5 mln tokenów pozostaje niepotwierdzone: nie ma go ani w komunikacji OpenAI, ani w relacjach z dnia premiery.
Skąd wzięła się przewaga Fable 5
Claude Fable 5 pojawił się 9 czerwca 2026 jako pierwszy model klasy Mythos udostępniony szeroko. Anthropic opisał go wtedy jako state of the art na prawie wszystkich testowanych benchmarkach, ale w samym komunikacie firmy próżno szukać konkretnych procentów dla poszczególnych testów.
Najczęściej cytowaną liczbą stał się wynik z SWE-Bench Pro, czyli zestawu prawdziwych zgłoszeń z repozytoriów, w którym model musi sam znaleźć właściwy plik, napisać poprawkę i przejść testy. W zestawieniu Anthropic, przytoczonym między innymi przez Vellum, Fable 5 uzyskał 80,3% wobec 58,6% dla GPT-5.5 i 69,2% dla wcześniejszego Opus 4.8. Ponad dwadzieścia punktów różnicy na takim teście to nie szum pomiarowy.
Kto policzył ten wynik i dlaczego to ma znaczenie
80,3% to liczba producenta: pochodzi z zestawienia Anthropic, a nie z pomiaru powtórzonego przez kogoś z zewnątrz. Warunków, w jakich model rozwiązywał zadania, żadne z cytowanych źródeł nie opisuje.
Niezależne agregatory notują Fable 5 nieco niżej, na poziomie 80,0%. Różnica jest kosmetyczna, ale zasada nie: dopóki pomiaru nie powtórzy ktoś spoza firmy, liczba z komunikatu prasowego jest materiałem marketingowym, a nie dowodem.
Większe okno kontekstu pomaga widzieć więcej naraz. Nie mówi jednak nic o tym, co model z tym kontekstem zrobi.
Co GPT-5.6 rzeczywiście dostarczył
Premiera się przesunęła. Zamiast czerwcowego wydania OpenAI udostępniło 26 czerwca 2026 ograniczony podgląd dla wąskiej grupy partnerów, a szeroka dostępność przyszła 9 lipca 2026. Wcześniej, jak podaje TechCrunch, administracja USA dążyła do ograniczenia wdrożenia modelu w obawie przed jego nadużyciem. Podobny mechanizm dotknął wcześniej modele Anthropic, o czym pisaliśmy przy okazji rządowej blokady Fable 5 i Mythos 5.
Rodzina ma trzy warianty: Luna (najtańszy), Terra (pośredni) i Sol (najmocniejszy). Po premierze na SWE-Bench Pro Sol notuje 64,6%, Terra 63,4%, a Luna 62,7%. Na Coding Agent Index prowadzonym przez Artificial Analysis Sol ustanowił nowy rekord z wynikiem 80 punktów, o 2,8 nad Fable 5, i zrobił to zużywając mniej niż połowę tokenów wyjściowych. OpenAI podaje przy tym 54% wyższą efektywność tokenową w zadaniach kodowania.
Domknięcie luki, nie skasowanie
Zestawmy to uczciwie. Na SWE-Bench Pro odstęp między liderem a najmocniejszym modelem OpenAI zmalał z ponad dwudziestu punktów procentowych do około piętnastu. To realny postęp w jednym wydaniu, ale nadal przegrana w tej konkretnej konkurencji. Na Coding Agent Index układ jest odwrotny i to Sol jest z przodu. Na Intelligence Index tego samego Artificial Analysis, mierzonym na początku września, wersja Fable 5.1 zebrała 66 punktów wobec 61 dla GPT-5.6 Sol.
Wniosek jest niewygodny dla nagłówków: nie ma jednego zwycięzcy, jest zwycięzca per benchmark. Pytanie „który model jest lepszy” zadane bez dopowiedzenia nie ma poprawnej odpowiedzi. Sensowna wersja brzmi: lepszy w czym, przy jakim budżecie i w jakiej konfiguracji.
Druga strona medalu: czego nie wiemy
Okno kontekstu 1,5 mln tokenów, które przed premierą trafiło do wielu zapowiedzi, nie pojawia się ani w materiałach OpenAI, ani w relacjach z dnia premiery. Dopóki nie trafi do dokumentacji, jest liczbą niepotwierdzoną i tak należy ją traktować. Zresztą sama pojemność okna mówi mniej, niż się wydaje: modele potrafią gubić szczegóły ze środka bardzo długiego dokumentu, o czym pisaliśmy w tekście o tym, jak AI gubi się w długim tekście.
Druga niewiadoma dotyczy jakości samego zbioru zadań. BenchLM odnotowuje, że audyt OpenAI z lipca 2026 uznał około 30% publicznych zadań tego benchmarku za wadliwe i wycofał wcześniejszą rekomendację jego stosowania, więc wynik wymaga sprawdzenia konfiguracji i doboru zadań, zanim posłuży za podstawę decyzji zakupowej. Trzecia rzecz jest najprostsza: wszystkie te testy mierzą pracę inżynierską w repozytoriach open source. Twoje zadania to najprawdopodobniej coś zupełnie innego.
Co z tego dla właściciela małej firmy
Jeśli nie budujesz własnego produktu opartego na modelu, żadna z powyższych liczb nie powinna sama decydować o wyborze narzędzia. Praktyczne konsekwencje są trzy.
Koszt. Liczy się nie cena za milion tokenów, tylko ile tokenów model zużyje na Twoje zadanie. Model droższy w cenniku, ale kończący pracę w połowie kroków, wychodzi taniej w rachunku miesięcznym. Dokładnie o tym jest podejście, które opisaliśmy jako tokenmaxxing.
Zastosowanie. Modele rozjeżdżają się mocniej w zadaniach agentowych, czyli wieloetapowych, z narzędziami i długimi sesjami, niż w prostym pisaniu tekstu. Jeśli Twoje użycie to opisy produktów, streszczenia i odpowiedzi na maile, różnica między czołówką rankingu a modelem klasę niżej będzie dla Ciebie niewidoczna, a różnica w rachunku bardzo widoczna.
Widoczność. To, którego modelu używasz wewnętrznie, nie ma żadnego związku z tym, czy asystenci AI polecają Twoją firmę klientom. To osobna robota, opisana szerzej w tekście o tym, co Claude Fable 5 zmienia w SEO i GEO.
Jak sprawdzić to u siebie w tydzień
Zamiast ufać cudzym tabelom, zrób własny mikrotest. Wystarczy tydzień i arkusz.
- Wypisz pięć zadań, które naprawdę zlecasz AI w firmie. Te powtarzalne, nie te z demo.
- Uruchom każde na dwóch modelach z różnych rodzin, przy identycznie sformułowanym poleceniu.
- Dla każdego przebiegu zapisz trzy rzeczy: czy wynik nadaje się do użycia bez poprawek, ile minut zajęła poprawka, ile kosztowało wywołanie.
- Po pięciu zadaniach masz własny ranking. Będzie się różnił od każdego publicznego i o to chodzi, bo mierzy Twój przypadek.
- Powtórz po każdej większej premierze. Czołówka przestawia się co kilka tygodni, czego dowodem jest to, że do gry weszły już Fable 5.1 i ChatGPT Astra, zanim ten spór zdążył się rozstrzygnąć.
Kontekst obu rodzin modeli opisaliśmy osobno: premierę Claude Fable 5 i Mythos 5 wraz z blokadą dystrybucji oraz co Fable 5.1 i Astra znaczą dla SEO, GEO i AEO.
Najczęstsze pytania
Zależy od benchmarku. Na SWE-Bench Pro Claude Fable 5 trzyma okolice 80 procent wobec 64,6 procent dla GPT-5.6 Sol. Na Coding Agent Index prowadzonym przez Artificial Analysis układ jest odwrotny: Sol ma 80 punktów, o 2,8 przed Fable 5.
Częściowo. Na SWE-Bench Pro luka zmalała z ponad dwudziestu punktów procentowych do około piętnastu, a na indeksie agentów kodujących GPT-5.6 Sol wyszedł na prowadzenie. Wyprzedzenia we wszystkich testach naraz nie ma.
Ta liczba pochodzi z zapowiedzi sprzed premiery i nie została potwierdzona ani w komunikacji OpenAI, ani w relacjach z dnia premiery 9 lipca 2026. Do czasu potwierdzenia traktuj ją jako niepewną.
Nie kierować się rankingiem. Wypisz pięć zadań, które naprawdę zlecasz AI, uruchom je na dwóch modelach przy tym samym poleceniu i zapisz trzy rzeczy: czy wynik nadaje się do użycia bez poprawek, ile trwała poprawka i ile kosztowało wywołanie.
Źródła: Anthropic, premiera Claude Fable 5 i Mythos 5 (9.06.2026), Vellum, zestawienie benchmarków Fable 5 (80,3% i 58,6% na SWE-Bench Pro, 69,2% dla Opus 4.8), llm-stats, tabela SWE-Bench Pro (80,0% Fable 5, 64,6% GPT-5.6 Sol, 58,6% GPT-5.5), BenchLM, tabela SWE-Bench Pro i zastrzeżenie o jakości zadań (8.09.2026), TechCrunch, premiera GPT-5.6 Sol, Terra i Luna oraz wynik 80 na Coding Agent Index (9.07.2026), heise online, Intelligence Index 66 dla Fable 5.1 wobec 61 dla GPT-5.6 Sol (2.09.2026).
Sprawdź, czy AI poleca Twoją firmę.
Zacznij od bezpłatnego audytu SEO i GEO. Sprawdzimy, jak modele AI opisują Twoją markę, i wskażemy priorytety zwiększające szanse na cytowanie.