Co doopravdy stojí AI agent

Ve zkratce: Ceník modelů je nejporovnávanější a nejméně rozhodující číslo v rozpočtu na AI. Podle vlastních dat Anthropicu spotřebuje jeden agent asi čtyřnásobek tokenů běžného chatu a systém s více agenty patnáctinásobek — násobič, který přebije jakýkoli cenový rozdíl mezi modely. Cachování většinu z toho vrátí u opakovaného kontextu, dávkové zpracování to půlí tam, kde nezáleží na rychlosti, a dvě největší položky nejsou tokeny vůbec: lidé, kteří výstup zpracují, a aparát, který ho dělá důvěryhodným.

Každý rozhovor o rozpočtu na AI začíná na stejném místě: cena za milion tokenů. Je to čisté, porovnatelné a veřejné číslo — a na faktuře skoro to nejméně užitečné.

Proč. Podle vlastních měření Anthropicu spotřebuje jeden agent zhruba čtyřnásobek tokenů běžné chatové výměny a systém s více agenty asi patnáctinásobek. Rozdíl mezi třídami modelů je násobek několika jednotek. Rozdíl mezi architekturami je patnáctinásobek.

1CHAT4JEDENAGENT15VÍCEAGENTŮ
Spotřeba tokenů podle architektury Vztaženo k jedné běžné chatové výměně. Publikovaná čísla Anthropicu.

Levnější model v marnotratné architektuře vyjde dráž než drahý model v ukázněné. To je celý argument, všechno ostatní níž je detail.

Šest položek

Skutečný rozpočet má šest složek. Většina publikovaných odhadů pokryje první a skončí.

1. TOKENY MODELUvstup a výstup podle publikované sazby za milion2. NÁSOBIČ ARCHITEKTURYkolikrát se nad tou prací přemýšlí3. CACHOVÁNÍ A DÁVKYco se vrátí, pokud to tvar práce dovolí4. NÁSTROJE A INFRASTRUKTURAvyhledávání, načítání, úložiště, systémy, které agent volá5. LIDÉ, KTEŘÍ VÝSTUP ZPRACUJÍrevize, třídění, jednání podle toho, co vyprodukuje6. STAVBA A ÚDRŽBA APARÁTUkontroly, které dělají výstup důvěryhodnýmpoložky 5 a 6 se v odhadech skoro nikdy neobjeví
Co agent doopravdy stojí. První položku cituje každý, poslední dvě bývají největší.

1. Tokeny modelu

Publikované sazby ke srpnu 2026 — než je někam odcitujete, ověřte si aktuální ceník, protože se hýbou:

Model Vstup / 1M Výstup / 1M
Claude Opus 5 5 $ 25 $
Claude Sonnet 5 3 $ 15 $
Claude Haiku 4.5 1 $ 5 $

Všimněte si tvaru: výstup stojí napříč nabídkou pětkrát víc než vstup. Cokoli, co model nutí víc psát — upovídané formáty, zbytečná shrnutí, přemýšlení, které jste nepotřebovali — stojí pětkrát víc než cokoli, co ho nutí víc číst.

Rozpětí od nejlevnější po nejschopnější třídu je pětinásobek. Podržte si to číslo proti patnáctinásobku výše.

2. Násobič architektury

Tahle položka rozhoduje o faktuře a je to zároveň ta, kterou si nikdo předem nespočítá.

Agent není chatové volání. Čte, volá nástroje, dostává výsledky, uvažuje o nich a jde znovu — a každý ten krok s sebou nese celý nashromážděný kontext. Čísla Anthropicu: asi 4× chat u jednoho agenta, asi 15× u systému s více agenty. Zvlášť pak platí, že implementace s více agenty spotřebují na srovnatelné práci třikrát až desetkrát víc tokenů než jeden agent.

Ty násobiče nejsou plýtvání — kupují si za ně skutečnou schopnost, a zhruba 80 % rozdílu ve výkonu ve výzkumu Anthropicu vysvětluje právě tahle spotřeba. Musí ale být v odhadu dřív, než se staví, ne až v první měsíční faktuře.

3. Co se vrátí

Dva mechanismy vrátí velkou část zpátky a oba závisí na tvaru práce, ne na modelu.

Cachování. Cachovaný vstup se čte zhruba za desetinu základní vstupní ceny. Zápis do cache stojí asi 1,25násobek, takže se zaplatí od druhého požadavku, který tutéž předponu využije. Kandidátem je cokoli s velkou stabilní preambulí — systémový prompt, referenční dokument, seznam nástrojů — a jde obvykle o největší dostupnou úsporu, aniž byste na modelu cokoli měnili.

Háček je v tom, že cachování je shoda předpony: změňte jediný bajt kdekoli v předponě a všechno za ním padá. Časové razítko v systémovém promptu vás tiše připraví o celou slevu a nic vás nevaruje.

Dávkování. Práce, která nepotřebuje odpověď hned, běží přes dávkové API za poloviční cenu. Noční zpracování, dopočty, hromadná klasifikace — když nikdo nečeká, je to rovnou padesát procent dolů.

4. Nástroje a infrastruktura

Serverové nástroje mají vlastní měřáky — vyhledávání, načítání, čas běhu — a systémy, které agent volá, jsou systémy, které už platíte, jen se teď volají mnohem častěji. Agent, který se v každém kroku ptá vaší databáze, je zátěžový test, který jste si neobjednali.

Tahle položka bývá vedle tokenů malá. Stojí za pojmenování proto, že překvapí provoz, ne finanční.

5. Lidé, kteří výstup zpracují

Tady publikované odhady končí a začíná realita.

Když agentní systém Mozilly vynesl na světlo 271 zranitelností Firefoxu, podílelo se na jejich záplatování, revizích, třídění a vydání přes sto lidí. Ta linka posunula úzké hrdlo od hledání vad k jejich zpracování — neodstranila ho.

Spočítejte si to na vlastním případu poctivě. Agent, který denně vyprodukuje třicet nálezů tam, kde jich tým zvládne pět, vám nic neušetřil — postavil frontu. Ať platíte za tokeny cokoli, mzdová položka navázaná na ten výstup bývá větší.

6. Stavba a údržba aparátu

Poslední položka je ta, ke které se na tomhle webu pořád vracíme, protože pořád rozhoduje.

Agent, jehož výstup nikdo neumí ověřit, vyrábí práci, ne hodnotu. Postavit to, co ho kontroluje — rozhodčího, test, párování, sadu evaluací — je reálný inženýrský náklad a nekončí spuštěním. Ceny se hýbou, modely se mění, prompty se rozjíždějí, proces, který agent automatizuje, se upraví a agentovi to nikdo neřekne.

Počítejte s údržbou od začátku. Agent není nákup, je to systém s vlastníkem.

Jak ho nacenit, než ho postavíte

Pusťte jednu reprezentativní úlohu od začátku do konce a přečtěte skutečnou spotřebu. Ne odhad na token — reálné číslo z jednoho reálného běhu. Všechno ostatní je extrapolace z něčeho, co jste změřili.

Vynásobte poctivým objemem a pak architekturou, kterou opravdu potřebujete. Když návrh počítá se subagenty, aplikujte násobič dřív, než se zavážete.

Připočtěte čas na revize, který to vyvolá. V hodinách a v reálné sazbě. Tahle položka nejčastěji obrátí výsledek.

Připočtěte cenu stavby kontrol. Pokud u vás neexistuje laciný způsob, jak odlišit správné od nesprávného, je tím projektem tohle — a patří to do odhadu, ne do pozdějšího překvapení.

Pak se zeptejte, jestli to pořád vychází. Když ekonomika přežije jen v nejlevnější třídě a s nejtěsnějším nastavením, ostrý provoz nepřežije.

Poctivé shrnutí

Ceník modelů je veřejný, porovnatelný a klesá. Je to zároveň ta část rozpočtu, kterou ovlivníte nejmíň — tytéž modely si za tutéž cenu pronajme kdokoli ještě dnes odpoledne.

Co ovládáte vy, je kolikrát se nad tou prací přemýšlí, jestli se stabilní kontext cachuje, jestli to, co nespěchá, běží za polovinu, a jestli výstup dopadne někam, kde ho někdo vstřebá. To jsou rozhodnutí, ne položky v cizím ceníku.

Což je tentýž závěr jako všude jinde na tomhle webu, jen dorazil od faktury: výnos není v modelu.

Často kladené dotazy

Kolik stojí provoz AI agenta?

Tokenová složka je cena modelu za milion vynásobená tím, kolikrát nad věcí architektura nechá přemýšlet. Publikovaná čísla Anthropicu uvádějí u jednoho agenta asi čtyřnásobek tokenů běžné chatové výměny a u systému s více agenty asi patnáctinásobek — architektura tedy hýbe fakturou mnohem víc než volba modelu. Nad tím leží dvě položky, které žádný ceník neuvádí: lidé, kteří podle výstupu jednají, a stavba a údržba kontrol, které ten výstup dělají důvěryhodným.

Co je levnější, lepší model, nebo míň tokenů?

Skoro vždycky míň tokenů. Rozpětí mezi třídami modelů je násobek několika jednotek; rozpětí mezi chatovým voláním a systémem s více agenty je patnáct. Levnější model v marnotratné architektuře vyjde dráž než drahý model v ukázněné, takže architektura je první místo, kde hledat úspory.

Kolik doopravdy ušetří cachování promptu?

Cachovaný vstup se čte zhruba za desetinu základní vstupní ceny. Zápis do cache stojí asi 1,25násobek běžné ceny, takže se zaplatí od druhého požadavku, který stejnou předponu využije. U čehokoli s velkou stabilní preambulí — systémový prompt, referenční dokument, seznam nástrojů — jde obvykle o největší dostupnou úsporu a nevyžaduje žádnou změnu modelu.

Která položka nákladů se nejčastěji podceňuje?

Lidské náklady na zpracování výstupu. Když agentní systém Mozilly našel 271 zranitelností, na jejich záplatování, revizích, třídění a vydání se podílelo přes sto lidí. Agent, který vyprodukuje víc nálezů, než stačí váš tým zpracovat, úzké hrdlo přesunul, ne odstranil — a mzdová položka bývá mnohem větší než ta za API.

Jak si agenta naceníme, než ho postavíme?

Naceňte jednu reprezentativní úlohu od začátku do konce, místo odhadu na token. Pusťte ji jednou, přečtěte skutečnou spotřebu tokenů, vynásobte realistickým objemem a připočtěte čas na revize, které vyvolá, a cenu stavby kontrol nad výstupem. Když to vychází jen v nejlevnější třídě modelu a s nejtěsnějším nastavením, je ta ekonomika příliš tenká na to, aby přežila ostrý provoz.

O autorovi

Filip Salamon

Filip Salamon

CEO / CTO, Salamon Capital

Filip has spent his career between media and technology — filming for ŠKODA, Pilsner Urquell and Range Rover, then co-founding a startup in San Francisco, working with a YC-backed company and serving as CIO at Renato. He built ZEUS Legal AI and now runs the systems Salamon Capital operates on.

ZÁZEMÍ

  • Founder, ZEUS Legal AI
  • Former CIO, Renato
  • 15+ years across media and technology

V PRAXI

Tenhle postup jsme použili na vlastní firmu dřív než na cizí.

PODÍVEJTE SE NA NAŠI PRÁCI →

DALŠÍ ČTENÍ

Analýzy k měření, automatizaci a k tomu, co data reálně ukazují.

VŠECHNY ČLÁNKY →

SLUŽBY

Růst a akvizice, AI a automatizace na míru, a právo přes vlastní advokátní kancelář.

CO DĚLÁME →

REFERENCE

Co jsme postavili klientům i sobě a co se měřitelně změnilo.

PŘÍPADOVÉ STUDIE →