Co doopravdy stojí AI agent
Ve zkratce: Ceník modelů je nejporovnávanější a nejméně rozhodující číslo v rozpočtu na AI. Podle vlastních dat Anthropicu spotřebuje jeden agent asi čtyřnásobek tokenů běžného chatu a systém s více agenty patnáctinásobek — násobič, který přebije jakýkoli cenový rozdíl mezi modely. Cachování většinu z toho vrátí u opakovaného kontextu, dávkové zpracování to půlí tam, kde nezáleží na rychlosti, a dvě největší položky nejsou tokeny vůbec: lidé, kteří výstup zpracují, a aparát, který ho dělá důvěryhodným.
Každý rozhovor o rozpočtu na AI začíná na stejném místě: cena za milion tokenů. Je to čisté, porovnatelné a veřejné číslo — a na faktuře skoro to nejméně užitečné.
Proč. Podle vlastních měření Anthropicu spotřebuje jeden agent zhruba čtyřnásobek tokenů běžné chatové výměny a systém s více agenty asi patnáctinásobek. Rozdíl mezi třídami modelů je násobek několika jednotek. Rozdíl mezi architekturami je patnáctinásobek.
Levnější model v marnotratné architektuře vyjde dráž než drahý model v ukázněné. To je celý argument, všechno ostatní níž je detail.
Šest položek
Skutečný rozpočet má šest složek. Většina publikovaných odhadů pokryje první a skončí.
1. Tokeny modelu
Publikované sazby ke srpnu 2026 — než je někam odcitujete, ověřte si aktuální ceník, protože se hýbou:
| Model | Vstup / 1M | Výstup / 1M |
|---|---|---|
| Claude Opus 5 | 5 $ | 25 $ |
| Claude Sonnet 5 | 3 $ | 15 $ |
| Claude Haiku 4.5 | 1 $ | 5 $ |
Všimněte si tvaru: výstup stojí napříč nabídkou pětkrát víc než vstup. Cokoli, co model nutí víc psát — upovídané formáty, zbytečná shrnutí, přemýšlení, které jste nepotřebovali — stojí pětkrát víc než cokoli, co ho nutí víc číst.
Rozpětí od nejlevnější po nejschopnější třídu je pětinásobek. Podržte si to číslo proti patnáctinásobku výše.
2. Násobič architektury
Tahle položka rozhoduje o faktuře a je to zároveň ta, kterou si nikdo předem nespočítá.
Agent není chatové volání. Čte, volá nástroje, dostává výsledky, uvažuje o nich a jde znovu — a každý ten krok s sebou nese celý nashromážděný kontext. Čísla Anthropicu: asi 4× chat u jednoho agenta, asi 15× u systému s více agenty. Zvlášť pak platí, že implementace s více agenty spotřebují na srovnatelné práci třikrát až desetkrát víc tokenů než jeden agent.
Ty násobiče nejsou plýtvání — kupují si za ně skutečnou schopnost, a zhruba 80 % rozdílu ve výkonu ve výzkumu Anthropicu vysvětluje právě tahle spotřeba. Musí ale být v odhadu dřív, než se staví, ne až v první měsíční faktuře.
3. Co se vrátí
Dva mechanismy vrátí velkou část zpátky a oba závisí na tvaru práce, ne na modelu.
Cachování. Cachovaný vstup se čte zhruba za desetinu základní vstupní ceny. Zápis do cache stojí asi 1,25násobek, takže se zaplatí od druhého požadavku, který tutéž předponu využije. Kandidátem je cokoli s velkou stabilní preambulí — systémový prompt, referenční dokument, seznam nástrojů — a jde obvykle o největší dostupnou úsporu, aniž byste na modelu cokoli měnili.
Háček je v tom, že cachování je shoda předpony: změňte jediný bajt kdekoli v předponě a všechno za ním padá. Časové razítko v systémovém promptu vás tiše připraví o celou slevu a nic vás nevaruje.
Dávkování. Práce, která nepotřebuje odpověď hned, běží přes dávkové API za poloviční cenu. Noční zpracování, dopočty, hromadná klasifikace — když nikdo nečeká, je to rovnou padesát procent dolů.
4. Nástroje a infrastruktura
Serverové nástroje mají vlastní měřáky — vyhledávání, načítání, čas běhu — a systémy, které agent volá, jsou systémy, které už platíte, jen se teď volají mnohem častěji. Agent, který se v každém kroku ptá vaší databáze, je zátěžový test, který jste si neobjednali.
Tahle položka bývá vedle tokenů malá. Stojí za pojmenování proto, že překvapí provoz, ne finanční.
5. Lidé, kteří výstup zpracují
Tady publikované odhady končí a začíná realita.
Když agentní systém Mozilly vynesl na světlo 271 zranitelností Firefoxu, podílelo se na jejich záplatování, revizích, třídění a vydání přes sto lidí. Ta linka posunula úzké hrdlo od hledání vad k jejich zpracování — neodstranila ho.
Spočítejte si to na vlastním případu poctivě. Agent, který denně vyprodukuje třicet nálezů tam, kde jich tým zvládne pět, vám nic neušetřil — postavil frontu. Ať platíte za tokeny cokoli, mzdová položka navázaná na ten výstup bývá větší.
6. Stavba a údržba aparátu
Poslední položka je ta, ke které se na tomhle webu pořád vracíme, protože pořád rozhoduje.
Agent, jehož výstup nikdo neumí ověřit, vyrábí práci, ne hodnotu. Postavit to, co ho kontroluje — rozhodčího, test, párování, sadu evaluací — je reálný inženýrský náklad a nekončí spuštěním. Ceny se hýbou, modely se mění, prompty se rozjíždějí, proces, který agent automatizuje, se upraví a agentovi to nikdo neřekne.
Počítejte s údržbou od začátku. Agent není nákup, je to systém s vlastníkem.
Jak ho nacenit, než ho postavíte
Pusťte jednu reprezentativní úlohu od začátku do konce a přečtěte skutečnou spotřebu. Ne odhad na token — reálné číslo z jednoho reálného běhu. Všechno ostatní je extrapolace z něčeho, co jste změřili.
Vynásobte poctivým objemem a pak architekturou, kterou opravdu potřebujete. Když návrh počítá se subagenty, aplikujte násobič dřív, než se zavážete.
Připočtěte čas na revize, který to vyvolá. V hodinách a v reálné sazbě. Tahle položka nejčastěji obrátí výsledek.
Připočtěte cenu stavby kontrol. Pokud u vás neexistuje laciný způsob, jak odlišit správné od nesprávného, je tím projektem tohle — a patří to do odhadu, ne do pozdějšího překvapení.
Pak se zeptejte, jestli to pořád vychází. Když ekonomika přežije jen v nejlevnější třídě a s nejtěsnějším nastavením, ostrý provoz nepřežije.
Poctivé shrnutí
Ceník modelů je veřejný, porovnatelný a klesá. Je to zároveň ta část rozpočtu, kterou ovlivníte nejmíň — tytéž modely si za tutéž cenu pronajme kdokoli ještě dnes odpoledne.
Co ovládáte vy, je kolikrát se nad tou prací přemýšlí, jestli se stabilní kontext cachuje, jestli to, co nespěchá, běží za polovinu, a jestli výstup dopadne někam, kde ho někdo vstřebá. To jsou rozhodnutí, ne položky v cizím ceníku.
Což je tentýž závěr jako všude jinde na tomhle webu, jen dorazil od faktury: výnos není v modelu.
Často kladené dotazy
Kolik stojí provoz AI agenta?
Tokenová složka je cena modelu za milion vynásobená tím, kolikrát nad věcí architektura nechá přemýšlet. Publikovaná čísla Anthropicu uvádějí u jednoho agenta asi čtyřnásobek tokenů běžné chatové výměny a u systému s více agenty asi patnáctinásobek — architektura tedy hýbe fakturou mnohem víc než volba modelu. Nad tím leží dvě položky, které žádný ceník neuvádí: lidé, kteří podle výstupu jednají, a stavba a údržba kontrol, které ten výstup dělají důvěryhodným.
Co je levnější, lepší model, nebo míň tokenů?
Skoro vždycky míň tokenů. Rozpětí mezi třídami modelů je násobek několika jednotek; rozpětí mezi chatovým voláním a systémem s více agenty je patnáct. Levnější model v marnotratné architektuře vyjde dráž než drahý model v ukázněné, takže architektura je první místo, kde hledat úspory.
Kolik doopravdy ušetří cachování promptu?
Cachovaný vstup se čte zhruba za desetinu základní vstupní ceny. Zápis do cache stojí asi 1,25násobek běžné ceny, takže se zaplatí od druhého požadavku, který stejnou předponu využije. U čehokoli s velkou stabilní preambulí — systémový prompt, referenční dokument, seznam nástrojů — jde obvykle o největší dostupnou úsporu a nevyžaduje žádnou změnu modelu.
Která položka nákladů se nejčastěji podceňuje?
Lidské náklady na zpracování výstupu. Když agentní systém Mozilly našel 271 zranitelností, na jejich záplatování, revizích, třídění a vydání se podílelo přes sto lidí. Agent, který vyprodukuje víc nálezů, než stačí váš tým zpracovat, úzké hrdlo přesunul, ne odstranil — a mzdová položka bývá mnohem větší než ta za API.
Jak si agenta naceníme, než ho postavíme?
Naceňte jednu reprezentativní úlohu od začátku do konce, místo odhadu na token. Pusťte ji jednou, přečtěte skutečnou spotřebu tokenů, vynásobte realistickým objemem a připočtěte čas na revize, které vyvolá, a cenu stavby kontrol nad výstupem. Když to vychází jen v nejlevnější třídě modelu a s nejtěsnějším nastavením, je ta ekonomika příliš tenká na to, aby přežila ostrý provoz.