Ranking modeli AI i agentów we wrześniu 2026

Rynek AI rozjechał się na dwie części. Tanie i szybkie modele biorą prawie cały wolumen tokenów, a modele wygrywające benchmarki mają mały udział w realnym ruchu.
Wolumen tokenów zgarniają modele Flash
Ranking miesięczny liczy tokeny wejścia i wyjścia przechodzące przez jedno API. Siedem z dziesięciu pozycji to warianty budżetowe lub “flash”.
| # | Model | Autor | Tokeny (30 dni) | Zmiana |
|---|---|---|---|---|
| 1 | DeepSeek V4 Flash 0731 | deepseek | 49,2T | +74% |
| 2 | GPT-5.6 Luna | openai | 48,8T | +215% |
| 3 | Hy4 preview | tencent | 45,1T | nowy |
| 4 | GLM 5.3 Flash | z-ai | 42T | nowy |
| 5 | MiMo-V2.5 | xiaomi | 30T | +5% |
| 6 | Ox Alpha | stealth | 27,2T | >999% |
| 7 | Hy3 | tencent | 21,3T | -33% |
| 8 | DeepSeek V4 Flash 0423 | deepseek | 20,4T | -21% |
| 9 | Nemotron 3 Ultra (free) | nvidia | 18,5T | +63% |
| 10 | DeepSeek V4.1 Flash | deepseek | 18,2T | nowy |
Dwie nazwy zaskakują. Ox Alpha to model stealth bez ujawnionego dostawcy, a przerobił 27,2T tokenów. Tencent wszedł znikąd z dwoma modelami.
Benchmarki pokazują inny zestaw
Artificial Analysis Intelligence Index stawia na czele zupełnie inną grupę.
| # | Model | Wynik |
|---|---|---|
| 1 | Claude Fable 5.1 | 53,4 |
| 2 | Qwen3.8 Max | 53,4 |
| 3 | GPT-6 Astra (max) | 52,7 |
| 4 | Claude Opus 5 | 50,8 |
| 5 | Claude Fable 5 | 49,6 |
Anthropic ma trzy z pięciu najlepszych wyników. Anthropic ma też 2,5% tygodniowych zapytań. Ta różnica opisuje cały rynek: inteligencja sprzedaje licencje, cena sprzedaje tokeny.
Kto trzyma rynek
Udział w zapytaniach według autora modelu, tydzień od 7 września:
- openai 23,6% (+28%), największy pojedynczy autor,
- deepseek 22,6% (+3%), równo w zapytaniach i wyżej w tokenach,
- google 18,6% (+2%), stabilnie,
- tencent 7,2% (+105%), najszybszy wzrost,
- z-ai 7,0% (-22%), traci udział po premierze GLM 5.3,
- anthropic 2,5% (-5%), mało wolumenu, najwyższa jakość.
Szybkość liczy się bardziej niż szczytowa inteligencja
Praca agenta to nie jeden prompt. Jedno zadanie to dziesiątki wywołań narzędzi po kolei, a każde czeka na poprzednie. Opóźnienie mnoży się przez całą sesję, więc model dwa razy szybszy kończy zadanie w połowie czasu.
Cena mnoży się tak samo. Opisałem taki rachunek w tekście jak straciłem 900 zł na tokenach Gemini. Modele klasy Flash kosztują ułamek ceny za milion tokenów, dlatego autorzy narzędzi ustawiają je domyślnie, a modele frontier zostawiają na trudne kroki.
Na jakich modelach realnie pracują agenci
Każde narzędzie raportuje własny miks modeli. Wzorzec powtarza się wszędzie.
| Narzędzie | Trzy główne modele w tym miesiącu |
|---|---|
| Hermes Agent | DeepSeek V4 Flash 0731, GLM 5.3 Flash, Ox Alpha |
| Claude Code | GLM 5.3 Flash, Ox Alpha, GLM 5.3 |
| Kilo Code | Laguna S 2.1, Nemotron 3 Ultra, MiniMax M3 |
| Cline | GLM 5.3 Flash, DeepSeek V4 Flash 0731, Muse Spark 1.3 |
| pi | GLM 5.3 Flash, DeepSeek V4 Flash 0731, DeepSeek V4.1 Flash |
| omp | Ox Alpha, GLM 5.3 Flash, DeepSeek V4.1 Flash |
| DeepSeek Harness | Ox Alpha, DeepSeek V4 Flash 0731, GLM 5.3 Flash |
| OpenClaw | DeepSeek V4 Flash 0731, DeepSeek V4 Flash 0423, GLM 5.3 Flash |
| Codex | GPT-5.6 Sol, GPT-5.6 Luna, GPT-6 Astra |
Z tabeli wynikają trzy rzeczy. DeepSeek V4 Flash, GLM 5.3 Flash i Ox Alpha to wspólny domyślny wybór całej stawki. Codex jako jedyny pracuje na jednym dostawcy. A użytkownicy Claude Code kupują na tym routerze głównie tokeny GLM, nie Claude.
Dziesięć największych aplikacji i agentów
Ranking według tokenów z ostatniego pełnego dnia.
1. Hermes Agent, 1,49T
Otwarty, samodoskonalący się agent od Nous Research. Trzyma pamięć między sesjami, buduje wielokrotnego użytku umiejętności i ma ponad 40 narzędzi, w tym automatyzację przeglądarki i wizję. Jest pierwszy jednocześnie w produktywności, kodowaniu i agentach osobistych, na 469 modelach.
Plus: jeden agent obsługuje kod i codzienną automatyzację, z trwałą pamięcią. Minus: trwała pamięć i 40 narzędzi to szeroka powierzchnia ataku i duży stały kontekst.
2. Claude Code, 917B
Terminalowy agent kodujący od Anthropic. Czyta całe repozytorium, planuje zmiany w wielu plikach, uruchamia testy i poprawia błędy. Działa od grudnia 2025, użył 373 modeli.
Plus: najdojrzalsza pętla planowania i cyklu test-poprawka. Minus: CLI jest zamknięte, a kierowanie ruchu poza Anthropic wymaga obejścia.
3. Kilo Code, 568B
Otwarty agent kodujący dla VS Code, JetBrains i terminala. Pierwszy wśród wtyczek do IDE, działa od kwietnia 2025.
Plus: najszersze wsparcie edytorów, zespół zostaje przy swoich narzędziach. Minus: miks modeli opiera się na niszowych dostawcach, jak poolside i dots-studio, co jest zakładem o ich dostępność.
4. Cline, 395B
Otwarty agent w IDE, który przegląda kod, edytuje pliki, uruchamia komendy i steruje przeglądarką. Najstarszy na liście, działa od października 2024.
Plus: najdłuższa historia i wbudowana automatyzacja przeglądarki. Minus: model związany z IDE utrudnia pracę headless i w CI.
5. pi, 299B
Terminalowy agent kodujący budowany wokół własnej konfiguracji, dostępny od lutego 2026, już 8,12T tokenów łącznie.
Plus: zrównoważony miks modeli, awaria jednego dostawcy nie zatrzymuje pracy. Minus: młody projekt z ubogą dokumentacją, trudno ocenić plany.
6. omp, 200B
Terminalowy agent kodujący, pojawił się w maju 2026 i od razu wszedł do pierwszej dziesiątki, z Ox Alpha jako głównym modelem.
Plus: szybki wzrost i mocne wykorzystanie najtańszych szybkich modeli. Minus: strona nie publikuje prawie nic, a główny model jest stealth, bez dostawcy do kontaktu.
7. OpenClaw, 163B
Otwarty agent osobisty wpięty w komunikatory, uruchamia komendy, przegląda sieć, zarządza plikami i wysyła maile. Drugi w produktywności i agentach osobistych.
Plus: realne działania odpalasz z okna czatu, bez IDE. Minus: uruchamianie komend z komunikatora to najbardziej ryzykowna konfiguracja z tej listy.
8. DeepSeek Harness, 150B
Własne narzędzie DeepSeek, na GitHubie od sierpnia 2026. Prawie cały ruch idzie do Ox Alpha i wersji DeepSeek Flash.
Plus: strojone przez dostawcę modelu, więc wywołania narzędzi pasują do modelu. Minus: wyraźne przywiązanie do jednego dostawcy i brak dokumentacji poza repozytorium.
9. Codex, 128B
Agent kodujący od OpenAI. Pięć głównych modeli to modele OpenAI, czego nie robi żadne inne narzędzie.
Plus: głęboka integracja z trybami rozumowania GPT-5.6 i GPT-6. Minus: pełne uzależnienie od dostawcy, nie obniżysz kosztu tańszym modelem.
10. ISEKAI ZERO, 65,7B
Jedyna aplikacja spoza kodowania w pierwszej dziesiątce. Platforma interaktywnej fikcji, pierwsza w rozrywce, korzysta z 49 modeli.
Plus: dowód, że roleplay finansuje spory kawałek rynku inferencji. Minus: bez znaczenia dla pracy inżynierskiej i wąska pula modeli.
Dlaczego brakuje opencode
Jeden brak mnie zaskakuje: opencode nie wchodzi do pierwszej dziesiątki, choć pracuję na nim codziennie i konkuruje wprost z Claude Code oraz Cline. Dane rankingu tego nie tłumaczą, więc poniżej moje założenia.
- śledzenie jest dobrowolne: aplikacja pojawia się tylko wtedy, gdy wysyła nagłówki atrybucji, a prywatne zapytania odpadają przed agregacją,
- router jest opcjonalny: opencode łączy się wprost z Anthropic, OpenAI, GitHub Copilot i modelami lokalnymi, więc ruch z subskrypcji nigdy nie przechodzi przez OpenRouter,
- abonament wygrywa z rozliczeniem za tokeny: przy stałym planie Claude czy Copilot nie ma powodu, by tę samą pracę kierować do API płatnego za tokeny,
- atrybucja się rozjeżdża: własne tytuły i samodzielne konfiguracje lądują jako osobne małe wpisy zamiast jednej nazwy,
- próg jest wysoki: dziesiąte miejsce wymagało 65,7B tokenów dziennie, więc narzędzie może być popularne i nadal nie wejść do zestawienia.
Nic z tego nie oznacza, że opencode jest mały. Ranking liczy ruch na routerze, a nie instalacje, a narzędzie pozwalające podłączyć dowolnego dostawcę zawsze będzie tam niedoszacowane.
Co wynika z tych liczb
Ustaw model klasy Flash jako domyślny, a model frontier włączaj tylko do planowania i trudnego debugowania. Tak już działają czołowe narzędzia.
Wybieraj narzędzie, które pozwala zmieniać modele. Osiem z dziesięciu to potrafi, a uzależnienie od dostawcy to jedyny koszt, którego później nie renegocjujesz. Moje wnioski o frameworkach skracających kontekst agenta opisałem w tekście dlaczego Laravel, Yii i Rails są dobre do pracy z agentami.
Jedno zastrzeżenie: ranking mierzy popularność na jednym routerze, a nie jakość ani cały rynek. Model, który generuje więcej tokenów, nie jest lepszy, tylko bardziej rozgadany lub popularniejszy.
Źródło danych
Wszystkie liczby pochodzą z rankingu OpenRouter, dane o użyciu do 19 września 2026, opublikowane na licencji CC BY 4.0.