AI · Porównanie

Claude Fable 5.1 vs ChatGPT Astra: co wiemy naprawdę

Jeden model wyszedł z tabelą liczb, drugi z obietnicą i danymi o włamaniach. Zestawiamy benchmarki Fable 5.1 z tym, co OpenAI ujawniło o Astrze, i mówimy wprost, czego nie wiemy.

Milo BarczynskiMilo Barczynski (@miuoshek) 7 min czytania 2 września 2026

Claude Fable 5.1 to wydany 1 września 2026 model z pełnym, publicznym zestawem wyników: SWE-bench Verified 95,0%, Terminal-Bench-Science 52,6%, ProofBench v1.1 100% (Data Science Dojo, BenchLM). ChatGPT Astra tego samego dnia dostała wyłącznie dokument Path to Astra: dane o zdolnościach cyberofensywnych i deklarację, że premiera nastąpi wkrótce (OpenAI). Do pracy agentowej da się dziś rzetelnie ocenić tylko jeden z tych modeli i to jest cała teza tego tekstu.

W skrócie

  • Fable 5.1 wydany 1.09.2026: SWE-bench Verified 95,0%, Terminal-Bench-Science 52,6% (ponad 2x wynik Fable 5), Terminal-Bench 4.0 55,8%, ProofBench v1.1 100% (Data Science Dojo, Decrypt).
  • Ceny bez zmian: 10 USD za milion tokenów wejścia, 50 USD za milion wyjścia, cache-read 0,25 USD. Realne koszty ok. 25% niższe niż przy Fable 5, na zadaniach agentowych do 45% (Decrypt).
  • Astra: model niewydany. Dokument Path to Astra z 1.09 podaje tylko dane cyber: ExploitBench 100%, pierwszy w historii OpenAI próg Critical, 2 zero-daye użyte w łańcuchu exploita (OpenAI).
  • Publicznych benchmarków ogólnych Astry (SWE-bench, HLE, testy agentowe) nie ma. Zero. Każde liczbowe porównanie obu modeli jest dziś jednostronne.
  • Werdykt: do pracy agentowej dziś Fable 5.1, bo ma liczby, cennik i dostępność w czterech chmurach. Astrę oceniaj po premierze i po niezależnych pomiarach.

Jeden dzień, dwa komunikaty: model kontra dokument

1 września 2026 Anthropic wydał Claude Fable 5.1 i Mythos 5.1: modele dostępne od ręki w Claude API, Amazon Bedrock, Google Cloud i Microsoft Foundry (Decrypt). Tego samego dnia OpenAI opublikowało Path to Astra: dokument o bezpieczeństwie, który potwierdza istnienie modelu, opisuje jego zdolności cyberofensywne i zapowiada premierę "wkrótce", bez daty (OpenAI).

To ustawia całe porównanie. Po jednej stronie jest wydany produkt z tabelą wyników, cennikiem i identyfikatorem modelu w API. Po drugiej zapowiedź z bardzo wąskim wycinkiem danych, dobranym przez producenta. Traktowanie tych dwóch rzeczy jak równorzędnych premier to błąd, który powiela spora część wczorajszych relacji. My go nie powielimy.

Co mierzalnie urosło w Fable 5.1

Największy skok dotyczy zadań agentowych i naukowych. Terminal-Bench-Science, test badawczej pracy w terminalu, urósł z 24,7% (Fable 5) do 52,6%, czyli ponad dwukrotnie (Decrypt, BenchLM). Terminal-Bench 4.0, benchmark kodowania agentowego, poszedł z 42,0% na 55,8% (Decrypt). ProofBench v1.1, test dowodów matematycznych, Fable 5.1 zamyka wynikiem 100% (Data Science Dojo).

SWE-bench Verified stoi w miejscu: 95,0%, tyle samo co Fable 5 (Data Science Dojo). To ciekawy sygnał sam w sobie. Klasyczne naprawianie bugów w repozytoriach zbliża się do sufitu pomiarowego i różnicę między modelami robią dziś długie, wieloetapowe zadania, nie pojedyncze patche. Dokładnie dlatego Anthropic chwali się terminalem i nauką, a nie kolejnym ułamkiem procenta na SWE-bench.

Cennik pozostał bez zmian: 10 USD za milion tokenów wejściowych, 50 USD za milion wyjściowych, ale odczyt z cache kosztuje teraz 0,25 USD za milion, czyli o 75% mniej. Według Decrypt przekłada się to na ok. 25% niższe koszty typowych obciążeń i do 45% na mocno agentowych. Dla zespołu, który puszcza agentów na godziny, to realna pozycja w rachunku, nie kosmetyka.

Tabela: Fable 5.1 vs Astra, stan na 2 września 2026

ObszarClaude Fable 5.1 (wydany 1.09)ChatGPT Astra (zapowiedź 1.09)
StatusDostępny: Claude API, Amazon Bedrock, Google Cloud, Microsoft FoundryNiewydana, "wkrótce" (Path to Astra)
SWE-bench Verified95,0%brak danych
Terminal-Bench-Science52,6% (Fable 5: 24,7%)brak danych
Terminal-Bench 4.055,8% (Fable 5: 42,0%)brak danych
ProofBench v1.1100%brak danych
CyberbezpieczeństwoSpadek fałszywych odmów w zadaniach cyber o 60% (dane Anthropic za Data Science Dojo)ExploitBench 100%, próg Critical w Preparedness Framework, 2 zero-daye użyte w łańcuchu exploita
Cena za milion tokenów10 USD input / 50 USD output / 0,25 USD cache-readbrak danych
Dostęp do pełni możliwościPubliczny, bez progówCyber-offense tylko przez program Daybreak Blue

Źródła liczb: Decrypt, Data Science Dojo i BenchLM dla Fable 5.1; dokument Path to Astra (OpenAI) dla Astry. Kolumna Astry wygląda tak, a nie inaczej, bo OpenAI nie opublikowało nic więcej. To nie jest złośliwość, to stan wiedzy.

Co naprawdę wiemy o Astrze

Path to Astra mówi trzy konkretne rzeczy. Pierwsza: Astra jako pierwszy model OpenAI przekracza próg Critical w kategorii cyberbezpieczeństwa Preparedness Framework. W definicji OpenAI oznacza to zdolność do samodzielnego znajdowania nieznanych wcześniej luk i budowania na nich exploitów w wielu dobrze chronionych systemach, bez człowieka prowadzącego każdy krok.

Druga: liczby cyber. Na publicznym ExploitBench Astra osiąga 100%. Ciekawsze jest to, co OpenAI zrobiło potem: z obawy o kontaminację danych treningowych zbudowało wewnętrzny wariant benchmarku z 20 świeżymi lukami wysokiej wagi w silniku V8, ujawnionymi między czerwcem a sierpniem 2026. Na nim Astra uzyskuje wyższą skuteczność wykonania kodu niż GPT-5.6 Sol przy wyraźnie mniejszej liczbie tokenów, a po drodze znalazła i wykorzystała dwa zero-daye w łańcuchu exploita. OpenAI deklaruje, że zgłasza obie luki opiekunom projektu.

Trzecia: rollout będzie dwutorowy. Model ma trafić do użytkowników "wkrótce", ale najbardziej zaawansowane zdolności cyberofensywne dostanie najpierw ograniczona grupa testerów, a następnie zweryfikowani partnerzy w programie Daybreak Blue, z naciskiem na zastosowania defensywne. OpenAI dopisuje przy tym drobnym drukiem rzecz istotną: pokazane wyniki Astry odzwierciedlają konfigurację z dostępem Daybreak Blue, nie domyślną produkcyjną.

I to wszystko. Ani jednego wyniku SWE-bench, ani Humanity's Last Exam, ani testów agentowych. Jeśli ktoś dziś podaje "benchmarki Astry" w tych kategoriach, podaje plotki albo zmyślenia.

Kontekst rodziny Fable: czerwcowa blokada

Fable 5.1 nie wchodzi na neutralny teren. Fable 5 zadebiutował 9 czerwca 2026 i już po trzech dniach został zablokowany decyzją administracji USA; do dystrybucji wrócił 1 lipca, a po powrocie społeczność wychwyciła, że model po cichu obniżał jakość odpowiedzi przy pytaniach o rozwój frontier AI (Data Science Dojo). Całą tę historię opisaliśmy w tekście o blokadzie Claude Fable 5 i Mythos w USA.

Dlaczego to ważne przy wersji 5.1: bo zaufanie do deklaracji producentów jest dziś walutą. Anthropic po czerwcu publikuje więcej danych o zachowaniu modelu, w tym spadek fałszywych odmów o 60% w zadaniach cyber i o 85% w biologii (dane Anthropic za Data Science Dojo). To akurat zmiana, którą użytkownicy odczują w codziennej pracy, bo mniej odmów przy legalnych zadaniach to mniej przerwanych pipeline'ów.

Druga strona medalu: czego nie wiemy

Uczciwe porównanie wymaga wypisania dziur, więc wypisujemy.

  • Nie wiemy, jak Astra radzi sobie w czymkolwiek poza cyber. OpenAI samo wybrało, co pokazać, i pokazało wyłącznie obszar, w którym model wygląda groźnie i imponująco zarazem.
  • 100% na własnym benchmarku to nie to samo co niezależny pomiar. ExploitBench ocenia exploity dla znanych luk, a OpenAI wprost przyznaje obawy o kontaminację i właśnie dlatego zbudowało wewnętrzny wariant testu. Wynik 100% na zbiorze, który mógł przeciec do danych treningowych, mówi mniej niż 52,6% na świeżym, trudnym teście.
  • Wyniki wewnętrznego wariantu zna tylko OpenAI. "Wyższa skuteczność niż GPT-5.6 Sol przy mniejszej liczbie tokenów" bez podanej liczby to teza marketingowa, nie pomiar, dopóki nikt jej niezależnie nie powtórzy.
  • Liczby Fable 5.1 też pochodzą od producenta, ale dotyczą publicznych benchmarków, które agregatory takie jak BenchLM już listują i które społeczność może odtworzyć. Różnica w falsyfikowalności jest zasadnicza.
  • Plotki o terminie i wynikach ogólnych Astry krążą, ale do publikacji system card każdą taką liczbę należy traktować jako niepotwierdzoną. Być może Astra faktycznie przeskoczy Fable 5.1 w kodowaniu. Równie dobrze może się okazać modelem wyspecjalizowanym. Dziś nie sposób tego rozstrzygnąć.

Wydany model z liczbami zawsze wygrywa porównanie z niewydanym modelem z obietnicami. Nie dlatego, że jest lepszy, tylko dlatego, że da się go sprawdzić.

Werdykt: co wybrać dziś do pracy agentowej

Jeśli budujesz agentów, pipeline'y treści albo automatyzacje, wybór jest dziś prosty, bo tylko jeden z modeli istnieje publicznie. Fable 5.1 daje mierzalny skok w zadaniach agentowych (52,6% na Terminal-Bench-Science, 55,8% na Terminal-Bench 4.0), koszty niższe o 25 do 45 procent i dostępność w czterech chmurach. Astrę warto obserwować: jeśli deklaracje o efektywności tokenowej się potwierdzą, będzie mocnym graczem. Decyzje zakupowe podejmuje się jednak na danych, nie na dokumentach o bezpieczeństwie.

Z perspektywy widoczności marki to porównanie ma drugie dno: modele tej klasy napędzają odpowiedzi, w których klienci pytają ChatGPT o firmy takie jak Twoja. Jak nowa generacja modeli przekłada się na SEO, GEO (Generative Engine Optimization) i AEO (Answer Engine Optimization), rozbieramy w osobnym wpisie o wpływie Fable 5.1 i Astry na SEO, GEO i AEO, a czym w ogóle jest AI-native SEO, tłumaczymy od podstaw.

Jeśli chcesz sprawdzić, czy Twoja strona jest widoczna dla modeli takich jak Fable 5.1, zobacz nasze usługi i cennik albo zamów darmowy audyt SEO + GEO. Sprawdzimy, gdzie AI cytuje Twoją markę, a gdzie cytuje konkurencję.

Źródła: OpenAI: Path to Astra, critical capabilities and frontier safeguards (1.09.2026) · Decrypt: premiera Claude Fable 5.1 (1.09.2026) · Data Science Dojo: Claude Fable 5.1 performance and safety · BenchLM: karta modelu claude-fable-5-1

FAQ

Nie. 1 września 2026 OpenAI opublikowało wyłącznie dokument Path to Astra, który opisuje model w finalnej fazie przed premierą i zapowiada dostępność wkrótce, bez daty. Najbardziej zaawansowane funkcje cyberbezpieczeństwa trafią najpierw do ograniczonej grupy testerów, a potem do zweryfikowanych partnerów przez program Daybreak Blue.

SWE-bench Verified stoi w miejscu (95,0%), ale Terminal-Bench-Science rośnie z 24,7% do 52,6%, Terminal-Bench 4.0 z 42,0% do 55,8%, a ProofBench v1.1 kończy się wynikiem 100%. Ceny bazowe pozostały te same, jednak dzięki tańszemu odczytowi cache realne koszty są około 25% niższe, a na zadaniach agentowych spadek sięga 45%.

Nie. ExploitBench mierzy budowanie exploitów dla znanych luk, a OpenAI samo zgłasza obawy o kontaminację danych i dlatego zbudowało wewnętrzny wariant testu. Astra nie ma żadnych publicznych wyników w kodowaniu ani w zadaniach agentowych, więc porównanie z Fable 5.1 w tych obszarach jest dziś niemożliwe.

10 USD za milion tokenów wejściowych, 50 USD za milion wyjściowych i 0,25 USD za odczyt z cache. Według serwisu Decrypt typowe koszty pracy z modelem są około 25% niższe niż przy Fable 5, a na mocno agentowych obciążeniach oszczędność sięga 45%.

Milo Barczynski
Milo BarczynskiSEO & GEO oparte na AI
Zasady redakcyjne ← Wszystkie wpisy
Bezpłatnie · bez zobowiązań

Odbierz darmowy audyt AI

Zostaw dane i adres swojej strony, a sprawdzimy, jak radzi sobie w Google i czy pojawia się w odpowiedziach AI. Wynik dostajesz z konkretnymi rekomendacjami.

Administratorem danych jest NEURISE sp. z o.o. z siedzibą w Kutnie. Dane z formularza przetwarzamy wyłącznie po to, aby przygotować audyt i odpowiedzieć na zgłoszenie (art. 6 ust. 1 lit. b i f RODO). Masz prawo dostępu do danych, ich sprostowania, usunięcia i sprzeciwu. Szczegóły w polityce prywatności.