Polski podatek tokenowy
Wzięliśmy 12 realnych zadań biurowych — reklamację, windykację, grafik urlopowy, pismo do urzędu — i policzyliśmy, ile kosztuje ich wykonanie przez agenta AI po polsku, a ile po angielsku. Te same zadania, te same modele, 95 pomiarów, pełne transkrypty do pobrania. Całe badanie kosztowało 1,14 zł.
+50%
tokenów wejścia płaci polszczyzna w pętli agentowej (GPT-4o mini; MiniMax: +26%)
×7,7
tyle kosztuje pętla agentowa wobec pojedynczego zapytania na tym samym zadaniu (MiniMax: ×5,0)
+65%
więcej tokenów zjada IDENTYCZNE polskie wejście u MiniMax (u OpenAI: +48%)
Co dokładnie zmierzyliśmy
Każde zadanie zmierzyliśmy w dwóch trybach. Czat to jedno zapytanie i jedna odpowiedź. Pętla agentowa to pięć kroków, w których model za każdym razem dostaje całą dotychczasową historię plus wynik narzędzia — dokładnie tak rośnie kontekst prawdziwego agenta, który czyta skrzynkę, sprawdza bazę klientów i kalendarz, zanim odpowie. Wyniki narzędzi są syntetyczne i identyczne dla obu języków i obu modeli, więc różnice w tabeli robi język i model, nie przypadek.
Każde zadanie ma wariant polski i angielski o tej samej treści. Różnica tokenów wejścia między nimi to czysty narzut tokenizacji polszczyzny — „podatek", który płacisz przy każdym kroku agenta, bo tokenizatory modeli są trenowane głównie na angielskim.
Wyniki: tokeny wejścia w pętli agentowej (12 zadań łącznie)
GPT-4o mini (OpenAI)
MiniMax M2.7
MiniMax M2.7: suma EN z 11 zadań (1 pomiar zakończył się błędem API i został wykluczony — szczegóły w ograniczeniach).
Pełna tabela
| Model / tryb / język | Tokeny wejścia | Tokeny wyjścia | Koszt łączny |
|---|---|---|---|
| GPT-4o mini (OpenAI) · chat / pl | 2723 | 3350 | 0,0088 zł |
| GPT-4o mini (OpenAI) · chat / en | 1844 | 2404 | 0,0062 zł |
| GPT-4o mini (OpenAI) · pętla / pl | 58 715 | 16 633 | 0,0680 zł |
| GPT-4o mini (OpenAI) · pętla / en | 39 265 | 12 111 | 0,0476 zł |
| MiniMax M2.7 · chat / pl | 3097 | 7862 | 0,0901 zł |
| MiniMax M2.7 · chat / en | 1874 | 8546 | 0,0940 zł |
| MiniMax M2.7 · pętla / pl | 29 350 | 35 883 | 0,4506 zł |
| MiniMax M2.7 · pętla / en (n=11) | 21 295 | 30 680 | 0,3754 zł |
Ciekawostka, której się nie spodziewaliśmy: MiniMax ma gorszy tokenizator dla polskiego (+65% na identycznym wejściu wobec +48% u OpenAI), ale generuje na tyle dużo tokenów wyjściowych, że narzut kosztowy polszczyzny spada u niego do +10% (u GPT-4o mini: +43%). Wniosek praktyczny: podatek tokenowy płacisz głównie na wejściu, więc rośnie z każdym krokiem pętli — im dłużej agent pracuje, tym droższa robi się polszczyzna.
Gdzie polszczyzna płaci najwięcej
| Zadanie (pętla, wejście) | GPT-4o mini | MiniMax M2.7 |
|---|---|---|
| Opis produktu do sklepu | +72% | +86% |
| Notatka decyzyjna dla zarządu | +39% | +93% |
| Drugie wezwanie do zapłaty | +30% | +93% |
| Grafik zastępstw na urlopy | +111% | +-18% |
| Krótka oferta na sprzątanie biura | +41% | +48% |
| Miękkie przypomnienie o zaległej fakturze | +34% | +51% |
| Odpowiedź na reklamację butów | +39% | +40% |
| Aktualizacja cennika o podwyżkę | +52% | — |
| Streszczenie protokołu ze spotkania | +56% | +-7% |
| Aktualizacja FAQ o zwrotach | +51% | +-16% |
| Pismo do urzędu o przedłużenie terminu | +30% | +3% |
| Harmonogram wdrożenia systemu | +36% | +-15% |
Metodologia i ograniczenia
- 12 zadań biurowych (korespondencja, dokumenty, oferty, dane, planowanie), każde w wariancie PL i EN o tej samej treści — komplet w pliku zadania.json niżej.
- Pętla agentowa jest symulowana: 5 kroków, stałe syntetyczne wyniki narzędzi, pełna historia wysyłana w każdym kroku. Mierzymy koszt kontekstu, nie jakość odpowiedzi — to świadomy wybór, dzięki któremu pomiar jest w pełni powtarzalny.
- Ceny: oficjalne cenniki API (USD za 1M tokenów), kurs sztywny 3,62 zł/USD zapisany w danych. Limit odpowiedzi: 1024 tokeny na krok.
- Jedno uruchomienie na kombinację (bez uśredniania) — przy 95 pomiarach pojedynczy przebieg uznaliśmy za wystarczający dla wniosków o rzędach wielkości; wariancję zbada kolejna runda.
- 1 pomiar (MiniMax, pętla EN, jedno zadanie) zakończył się błędem API i jest wykluczony z sum — dlatego przy tym segmencie stoi n=11.
- Nie mierzymy jakości odpowiedzi ani nie porównujemy „który model lepszy” — wyłącznie koszt tej samej pracy w dwóch językach.
Dane do pobrania
Licencja CC BY 4.0 — bierz, licz, podważaj. Jeśli znajdziesz błąd w metodologii, napisz: poprawimy i dopiszemy erratę.
Co z tym zrobić w firmie
Podatek tokenowy nie znaczy, że agent po polsku się nie opłaca — znaczy, że rachunek trzeba zrobić na polskich liczbach, nie na angielskich benchmarkach. Jak go policzyć krok po kroku, uczy darmowa lekcja o mierzeniu efektu, a próg opłacalności wyliczysz kalkulatorem w lekcji.