AI · Modele

VibeThinker-3B: 3 miliardy parametrów, a wyniki jak u gigantów

Chiński model o zaledwie 3 miliardach parametrów rozwiązuje zadania matematyczne i programistyczne na poziomie rywali 200 razy większych. To nie przypadek - to sygnał, że rozumowanie można kompresować. Tłumaczymy, jak to działa i co z tego wynika dla Twojej firmy.

Redakcja NeuriseRedakcja Neurise 6 min czytania 28 czerwca 2026

VibeThinker-3B to otwarty model językowy stworzony przez chińską firmę Sina - właściciela serwisu Weibo. Przy zaledwie 3 miliardach parametrów model osiąga wyniki porównywalne z modelami wielokrotnie większymi w zadaniach z matematyki i programowania. Jego czerwcowy debiut pokazuje wyraźnie, że przewaga nie leży już w samym rozmiarze sieci, lecz w tym, jak model się uczy rozumować.

W skrócie

  • VibeThinker-3B (Sina/Weibo) ma 3 mld parametrów i bazuje na otwartym Qwen2.5-Coder-3B od Alibaby.
  • Na benchmarku AIME26 dorównuje DeepSeek V3.2 i Kimi K2.5, które są odpowiednio około 200 i 333 razy większe.
  • W konkursie LeetCode (kwiecień-maj 2026) rozwiązał 123 ze 128 zadań przy pierwszej próbie i wyprzedza każdy model poniżej 20 mld parametrów na LiveCodeBench.
  • Klucz to trzyetapowy przepis "Spectrum-to-Signal": nadzorowane dostrajanie, równolegle uczenie ze wzmocnieniem na matematyce, kodzie i naukach ścisłych, oraz offline'owa samodestylacja.

Skąd wziął się VibeThinker-3B

Za modelem stoi Sina, chińska korporacja medialna najbardziej znana z Weibo - odpowiednika Twittera. Zespół Weibo AI nie budował architektury od zera: oparł się na publicznie dostępnym modelu Qwen2.5-Coder-3B od Alibaby i skupił całą energię na procesie treningu. Model trafił do publicznej sieci w połowie czerwca 2026 (raport techniczny na arXiv opublikowano 15 czerwca) na licencji MIT, co oznacza, że każdy może pobrać jego wagi i wdrożyć go we własnej infrastrukturze.

Wagi w formacie BF16 zajmują około 6 GB - tyle, że model uruchamia się na pojedynczej karcie graficznej. Mimo to twórcy Weibo zdecydowali się zmierzyć z modelami wymagającymi dziesiątki, a nawet setki razy większej mocy obliczeniowej. I nie wyszli z tej konfrontacji źle.

Co pokazują wyniki na benchmarkach

Najtwardszym sprawdzianem dla modeli rozumujących jest AIME26, czyli olimpiada matematyczna używana do oceny modeli AI. VibeThinker-3B uzyskał tu wynik 94.3, porównywalny z DeepSeek V3.2 (671 mld parametrów) i Kimi K2.5 (około 1 biliona parametrów). Liczby mówią same za siebie: jeden model robi podobną robotę za ułamek zasobów pozostałych dwóch.

W konkursie programistycznym LeetCode z edycji kwiecień-maj 2026 model rozwiązał 123 ze 128 zadań przy pierwszej próbie (96,1% skuteczności). Na benchmarku LiveCodeBench v6, który mierzy zdolność pisania działającego kodu, VibeThinker-3B osiąga 80.2 Pass@1 i pokonuje każdy inny model o rozmiarze poniżej 20 miliardów parametrów.

Nie każdy test wypada równie dobrze. Na GPQA-Diamond, sprawdzającym szerszą wiedzę naukową, model uzyskał 70.2 - wyraźnie mniej niż np. Gemini 3 Pro (91.9) czy Claude Opus 4.5 (87.0). To ważna wskazówka: logiczne rozumowanie i algorytmiczne myślenie dają się kompresować, wiedza encyklopedyczna - znacznie gorzej.

Jak wytrenowali tak mały model tak dobrze

Zespół Weibo AI opisał własny przepis, nazwany "Spectrum-to-Signal". Składa się z trzech głównych etapów, każdy buduje na poprzednim:

  • Etap 1 - nadzorowane dostrajanie oparte na krzywej uczenia (SFT). Model uczy się na wysokiej jakości przykładach: mocniejsze modele-nauczyciele generują wiele wariantów rozumowania dla każdego zadania, a najlepsze ścieżki wybierane są m.in. przez weryfikację odpowiedzi w sandboksie kodu. Ten etap buduje szerokie "spektrum" możliwych, poprawnych sposobów rozumowania.
  • Etap 2 - uczenie ze wzmocnieniem na wielu dziedzinach równolegle (RL, metoda MGPO). Model trenowany jest jednocześnie na matematyce, kodzie i naukach ścisłych, z naciskiem na zadania, które rozwiązuje "czasem, ale nie zawsze" - to tu ze spektrum możliwości wyłania się mocny "sygnał" poprawnych strategii.
  • Etap 3 - offline'owa samodestylacja. Na koniec checkpointy z etapu RL są łączone (uśredniane), co stabilizuje i utrwala zdobyte umiejętności w jednym, zwartym zestawie wag - bez rozrostu rozmiaru modelu.

Rozumowanie logiczne kompresuje się znacznie lepiej niż wiedza faktograficzna. VibeThinker-3B to dowód, że można wycisnąć z małego modelu wielki talent do kodu i matematyki.

Wyprzedza GPT-5.2, Claude i Kimi w wybranych testach

Autorzy twierdzą, że na zadaniach z konkursów LeetCode (kwiecień-maj 2026) VibeThinker-3B osiągnął 96,1% skuteczności, wyprzedzając GPT-5.2 (95,3%) i Kimi K2.5 (90,6%) oraz całą linię modeli Claude 4.6. Ogólnie w weryfikowalnym rozumowaniu (matematyka, kod) model osiąga poziom porównywalny z GLM-5, Kimi K2.5, Gemini 3 Pro i Claude Opus 4.5. To twierdzenia producenta z własnego raportu technicznego - niezależna weryfikacja jeszcze nie nastąpiła, więc należy traktować je z odpowiednim dystansem. Niemniej wyniki na LiveCodeBench i LeetCode są weryfikowalne i robią wrażenie nawet przy ostrożnej ocenie.

Warto pamiętać, czego model nie potrafi. Słabszy wynik na GPQA-Diamond jasno mówi, że VibeThinker-3B to wyspecjalizowane narzędzie do zadań algorytmicznych, nie uniwersalny asystent. Wybierając model do konkretnego zadania, zawsze warto sprawdzić, który benchmark go opisuje lepiej.

Ten sam trend widać po stronie budżetów. Opisujemy go w tekście o tokenmaxxingu, czyli końcu ery przepalania pieniędzy na AI.

Co zwrot ku małym modelom zmienia dla Twojej firmy

Historia VibeThinker-3B przekłada się bezpośrednio na strategię każdej firmy myślącej o AI i widoczności w sieci. Kilka konkretnych konsekwencji:

  • Mniejsze modele to niższy koszt wdrożenia. Jeśli model klasy "mały" osiąga wyniki klasy "duży", automatyzacja prostych zadań - czat na stronie, kategoryzacja zapytań klientów, generowanie opisów produktów - przestaje być zarezerwowana dla korporacji z budżetem na AWS.
  • AI na krawędzi (edge AI) to już realna opcja. Modele o 3 miliardach parametrów uruchamiają się lokalnie, bez wysyłania danych do zewnętrznych serwerów. Dla firm przetwarzających wrażliwe dane klientów to argument za bezpieczeństwem i zgodnością z RODO. Sprzęt do uruchamiania modeli u siebie opisujemy w tekście o Nvidia DGX Spark.
  • Większy wybór narzędzi, większy wybór strategii. Klienci szukają odpowiedzi nie tylko w Google, ale również w ChatGPT, Gemini czy Perplexity. Rozwijający się ekosystem małych, wyspecjalizowanych modeli oznacza, że pytania będą padać w coraz większej liczbie miejsc. Jeśli Twoja firma nie jest dobrze opisana w sieci jako autorytet w swojej dziedzinie, żadne z tych narzędzi nie będzie jej rekomendować.
  • SEO i GEO to wciąż fundament. Model AI - niezależnie od producenta i rozmiaru - czerpie wiedzę o świecie ze stron internetowych i artykułów branżowych. Firma, która publikuje rzetelne treści i buduje widoczność w Google, ma większe szanse na pojawienie się w odpowiedziach AI. Zasady tej drugiej dyscypliny rozkładamy na czynniki pierwsze w przewodniku po GEO. Mały model nie zmienia tej mechaniki. Można powiedzieć, że ją wzmacnia, bo szybciej i częściej odpowiada na pytania użytkowników bez odsyłania ich do przeglądarki.

Najczęstsze pytania

VibeThinker-3B to otwarty model językowy stworzony przez chińską firmę Sina (właściciel serwisu Weibo). Ma zaledwie 3 miliardy parametrów i bazuje na modelu Qwen2.5-Coder-3B od Alibaby. Pomimo małego rozmiaru osiąga wyniki porównywalne z modelami 200-333 razy większymi w testach matematycznych i programistycznych.

Na benchmarku AIME26 VibeThinker-3B uzyskał wynik 94.3, dorównując modelom DeepSeek V3.2 i Kimi K2.5, które są odpowiednio około 200 i 333 razy większe. Na tegorocznej edycji LeetCode (kwiecień-maj 2026) rozwiązał 123 ze 128 zadań przy pierwszej próbie. Na LiveCodeBench pokonuje każdy model poniżej 20 miliardów parametrów. Słabszym punktem pozostaje GPQA-Diamond, gdzie osiągnął 70.2 i wyraźnie ustępuje większym rywalom.

Zespół Weibo AI wytrenował model trzyetapowym przepisem "Spectrum-to-Signal": najpierw nadzorowane dostrajanie na starannie wyselekcjonowanych ścieżkach rozumowania, potem uczenie ze wzmocnieniem równolegle na matematyce, kodzie i naukach ścisłych (metoda MGPO), a na koniec offline'owa samodestylacja łącząca checkpointy treningowe w jeden, zwarty zestaw wag.

Mniejsze modele to niższy koszt wdrożenia i możliwość uruchomienia AI lokalnie - bez wysyłania danych do zewnętrznych serwerów. Dla właściciela MŚP oznacza to, że dostęp do sprawnego narzędzia AI przestaje wymagać gigantycznego budżetu. Jednak niezależnie od tego, z jakiego modelu korzystają Twoi klienci, wciąż zadają pytania w Google i asystentach AI - i nadal liczy się, czy Twoja firma pojawia się w odpowiedziach.

Tak, VibeThinker-3B to model otwarty (open-source), co oznacza, że jego wagi są publicznie dostępne. Każdy deweloper lub firma może pobrać model i wdrożyć go we własnej infrastrukturze.

Źródła: arxiv.org: VibeThinker-3B - Exploring the Frontier of Verifiable Reasoning (2606.16140), GitHub: WeiboAI/VibeThinker - oficjalne repozytorium modelu, VentureBeat: Why Weibo's tiny VibeThinker-3B has the AI world arguing over benchmarks again, LiveCodeBench - benchmark kodowania.

Powiązane artykuły

Redakcja Neurise
Redakcja NeuriseSEO & GEO oparte na AI
← Wszystkie wpisy

Sprawdź, czy AI poleca Twoją firmę.

Zacznij od bezpłatnego audytu SEO i GEO. Sprawdzimy, jak modele AI opisują Twoją markę, i wskażemy priorytety zwiększające szanse na cytowanie.

Bezpłatnie · bez zobowiązań

Odbierz darmowy audyt AI

Zostaw dane i adres swojej strony, a sprawdzimy, jak radzi sobie w Google i czy pojawia się w odpowiedziach AI. Wynik dostajesz z konkretnymi rekomendacjami.

Administratorem danych jest NEURISE sp. z o.o. z siedzibą w Kutnie. Dane z formularza przetwarzamy wyłącznie po to, aby przygotować audyt i odpowiedzieć na zgłoszenie (art. 6 ust. 1 lit. b i f RODO). Masz prawo dostępu do danych, ich sprostowania, usunięcia i sprzeciwu. Szczegóły w polityce prywatności.