Ranking modeli AI i agentów we wrześniu 2026

Słupki wolumenu tokenów obok wyników benchmarków modeli.

Rynek AI rozjechał się na dwie części. Tanie i szybkie modele biorą prawie cały wolumen tokenów, a modele wygrywające benchmarki mają mały udział w realnym ruchu.

Wolumen tokenów zgarniają modele Flash

Ranking miesięczny liczy tokeny wejścia i wyjścia przechodzące przez jedno API. Siedem z dziesięciu pozycji to warianty budżetowe lub “flash”.

# Model Autor Tokeny (30 dni) Zmiana
1 DeepSeek V4 Flash 0731 deepseek 49,2T +74%
2 GPT-5.6 Luna openai 48,8T +215%
3 Hy4 preview tencent 45,1T nowy
4 GLM 5.3 Flash z-ai 42T nowy
5 MiMo-V2.5 xiaomi 30T +5%
6 Ox Alpha stealth 27,2T >999%
7 Hy3 tencent 21,3T -33%
8 DeepSeek V4 Flash 0423 deepseek 20,4T -21%
9 Nemotron 3 Ultra (free) nvidia 18,5T +63%
10 DeepSeek V4.1 Flash deepseek 18,2T nowy

Dwie nazwy zaskakują. Ox Alpha to model stealth bez ujawnionego dostawcy, a przerobił 27,2T tokenów. Tencent wszedł znikąd z dwoma modelami.

Benchmarki pokazują inny zestaw

Artificial Analysis Intelligence Index stawia na czele zupełnie inną grupę.

# Model Wynik
1 Claude Fable 5.1 53,4
2 Qwen3.8 Max 53,4
3 GPT-6 Astra (max) 52,7
4 Claude Opus 5 50,8
5 Claude Fable 5 49,6

Anthropic ma trzy z pięciu najlepszych wyników. Anthropic ma też 2,5% tygodniowych zapytań. Ta różnica opisuje cały rynek: inteligencja sprzedaje licencje, cena sprzedaje tokeny.

Kto trzyma rynek

Udział w zapytaniach według autora modelu, tydzień od 7 września:

  • openai 23,6% (+28%), największy pojedynczy autor,
  • deepseek 22,6% (+3%), równo w zapytaniach i wyżej w tokenach,
  • google 18,6% (+2%), stabilnie,
  • tencent 7,2% (+105%), najszybszy wzrost,
  • z-ai 7,0% (-22%), traci udział po premierze GLM 5.3,
  • anthropic 2,5% (-5%), mało wolumenu, najwyższa jakość.

Szybkość liczy się bardziej niż szczytowa inteligencja

Praca agenta to nie jeden prompt. Jedno zadanie to dziesiątki wywołań narzędzi po kolei, a każde czeka na poprzednie. Opóźnienie mnoży się przez całą sesję, więc model dwa razy szybszy kończy zadanie w połowie czasu.

Cena mnoży się tak samo. Opisałem taki rachunek w tekście jak straciłem 900 zł na tokenach Gemini. Modele klasy Flash kosztują ułamek ceny za milion tokenów, dlatego autorzy narzędzi ustawiają je domyślnie, a modele frontier zostawiają na trudne kroki.

Na jakich modelach realnie pracują agenci

Każde narzędzie raportuje własny miks modeli. Wzorzec powtarza się wszędzie.

Narzędzie Trzy główne modele w tym miesiącu
Hermes Agent DeepSeek V4 Flash 0731, GLM 5.3 Flash, Ox Alpha
Claude Code GLM 5.3 Flash, Ox Alpha, GLM 5.3
Kilo Code Laguna S 2.1, Nemotron 3 Ultra, MiniMax M3
Cline GLM 5.3 Flash, DeepSeek V4 Flash 0731, Muse Spark 1.3
pi GLM 5.3 Flash, DeepSeek V4 Flash 0731, DeepSeek V4.1 Flash
omp Ox Alpha, GLM 5.3 Flash, DeepSeek V4.1 Flash
DeepSeek Harness Ox Alpha, DeepSeek V4 Flash 0731, GLM 5.3 Flash
OpenClaw DeepSeek V4 Flash 0731, DeepSeek V4 Flash 0423, GLM 5.3 Flash
Codex GPT-5.6 Sol, GPT-5.6 Luna, GPT-6 Astra

Z tabeli wynikają trzy rzeczy. DeepSeek V4 Flash, GLM 5.3 Flash i Ox Alpha to wspólny domyślny wybór całej stawki. Codex jako jedyny pracuje na jednym dostawcy. A użytkownicy Claude Code kupują na tym routerze głównie tokeny GLM, nie Claude.

Dziesięć największych aplikacji i agentów

Ranking według tokenów z ostatniego pełnego dnia.

1. Hermes Agent, 1,49T

Otwarty, samodoskonalący się agent od Nous Research. Trzyma pamięć między sesjami, buduje wielokrotnego użytku umiejętności i ma ponad 40 narzędzi, w tym automatyzację przeglądarki i wizję. Jest pierwszy jednocześnie w produktywności, kodowaniu i agentach osobistych, na 469 modelach.

Plus: jeden agent obsługuje kod i codzienną automatyzację, z trwałą pamięcią. Minus: trwała pamięć i 40 narzędzi to szeroka powierzchnia ataku i duży stały kontekst.

2. Claude Code, 917B

Terminalowy agent kodujący od Anthropic. Czyta całe repozytorium, planuje zmiany w wielu plikach, uruchamia testy i poprawia błędy. Działa od grudnia 2025, użył 373 modeli.

Plus: najdojrzalsza pętla planowania i cyklu test-poprawka. Minus: CLI jest zamknięte, a kierowanie ruchu poza Anthropic wymaga obejścia.

3. Kilo Code, 568B

Otwarty agent kodujący dla VS Code, JetBrains i terminala. Pierwszy wśród wtyczek do IDE, działa od kwietnia 2025.

Plus: najszersze wsparcie edytorów, zespół zostaje przy swoich narzędziach. Minus: miks modeli opiera się na niszowych dostawcach, jak poolside i dots-studio, co jest zakładem o ich dostępność.

4. Cline, 395B

Otwarty agent w IDE, który przegląda kod, edytuje pliki, uruchamia komendy i steruje przeglądarką. Najstarszy na liście, działa od października 2024.

Plus: najdłuższa historia i wbudowana automatyzacja przeglądarki. Minus: model związany z IDE utrudnia pracę headless i w CI.

5. pi, 299B

Terminalowy agent kodujący budowany wokół własnej konfiguracji, dostępny od lutego 2026, już 8,12T tokenów łącznie.

Plus: zrównoważony miks modeli, awaria jednego dostawcy nie zatrzymuje pracy. Minus: młody projekt z ubogą dokumentacją, trudno ocenić plany.

6. omp, 200B

Terminalowy agent kodujący, pojawił się w maju 2026 i od razu wszedł do pierwszej dziesiątki, z Ox Alpha jako głównym modelem.

Plus: szybki wzrost i mocne wykorzystanie najtańszych szybkich modeli. Minus: strona nie publikuje prawie nic, a główny model jest stealth, bez dostawcy do kontaktu.

7. OpenClaw, 163B

Otwarty agent osobisty wpięty w komunikatory, uruchamia komendy, przegląda sieć, zarządza plikami i wysyła maile. Drugi w produktywności i agentach osobistych.

Plus: realne działania odpalasz z okna czatu, bez IDE. Minus: uruchamianie komend z komunikatora to najbardziej ryzykowna konfiguracja z tej listy.

8. DeepSeek Harness, 150B

Własne narzędzie DeepSeek, na GitHubie od sierpnia 2026. Prawie cały ruch idzie do Ox Alpha i wersji DeepSeek Flash.

Plus: strojone przez dostawcę modelu, więc wywołania narzędzi pasują do modelu. Minus: wyraźne przywiązanie do jednego dostawcy i brak dokumentacji poza repozytorium.

9. Codex, 128B

Agent kodujący od OpenAI. Pięć głównych modeli to modele OpenAI, czego nie robi żadne inne narzędzie.

Plus: głęboka integracja z trybami rozumowania GPT-5.6 i GPT-6. Minus: pełne uzależnienie od dostawcy, nie obniżysz kosztu tańszym modelem.

10. ISEKAI ZERO, 65,7B

Jedyna aplikacja spoza kodowania w pierwszej dziesiątce. Platforma interaktywnej fikcji, pierwsza w rozrywce, korzysta z 49 modeli.

Plus: dowód, że roleplay finansuje spory kawałek rynku inferencji. Minus: bez znaczenia dla pracy inżynierskiej i wąska pula modeli.

Dlaczego brakuje opencode

Jeden brak mnie zaskakuje: opencode nie wchodzi do pierwszej dziesiątki, choć pracuję na nim codziennie i konkuruje wprost z Claude Code oraz Cline. Dane rankingu tego nie tłumaczą, więc poniżej moje założenia.

  • śledzenie jest dobrowolne: aplikacja pojawia się tylko wtedy, gdy wysyła nagłówki atrybucji, a prywatne zapytania odpadają przed agregacją,
  • router jest opcjonalny: opencode łączy się wprost z Anthropic, OpenAI, GitHub Copilot i modelami lokalnymi, więc ruch z subskrypcji nigdy nie przechodzi przez OpenRouter,
  • abonament wygrywa z rozliczeniem za tokeny: przy stałym planie Claude czy Copilot nie ma powodu, by tę samą pracę kierować do API płatnego za tokeny,
  • atrybucja się rozjeżdża: własne tytuły i samodzielne konfiguracje lądują jako osobne małe wpisy zamiast jednej nazwy,
  • próg jest wysoki: dziesiąte miejsce wymagało 65,7B tokenów dziennie, więc narzędzie może być popularne i nadal nie wejść do zestawienia.

Nic z tego nie oznacza, że opencode jest mały. Ranking liczy ruch na routerze, a nie instalacje, a narzędzie pozwalające podłączyć dowolnego dostawcę zawsze będzie tam niedoszacowane.

Co wynika z tych liczb

Ustaw model klasy Flash jako domyślny, a model frontier włączaj tylko do planowania i trudnego debugowania. Tak już działają czołowe narzędzia.

Wybieraj narzędzie, które pozwala zmieniać modele. Osiem z dziesięciu to potrafi, a uzależnienie od dostawcy to jedyny koszt, którego później nie renegocjujesz. Moje wnioski o frameworkach skracających kontekst agenta opisałem w tekście dlaczego Laravel, Yii i Rails są dobre do pracy z agentami.

Jedno zastrzeżenie: ranking mierzy popularność na jednym routerze, a nie jakość ani cały rynek. Model, który generuje więcej tokenów, nie jest lepszy, tylko bardziej rozgadany lub popularniejszy.

Źródło danych

Wszystkie liczby pochodzą z rankingu OpenRouter, dane o użyciu do 19 września 2026, opublikowane na licencji CC BY 4.0.