Newsletter 365tipů můžete číst zdarma. Placené předplatné je dobrovolná podpora, která pomáhá webu pokračovat.
Podpořit 365tipů

TIP#3292: AI přes API zadara? Ale jo, na zkoumání a zkoušení to jde, na produkci ale spíš ne

Kupodivu možností, jak mít AI/LLM přes API zdarma, je docela dost. Zdarma ale zpravidla znamená různá omezení – počty dotazů za minutu nebo den, množství tokenů, menší výběr modelů nebo nižší prioritu při vytížení služby.

Pozor také na data, která přes bezplatná API posíláte. U některých služeb mohou být prompty a odpovědi používány pro zlepšování nebo trénování modelů. U placeného tarifu přitom mohou platit úplně jiná pravidla.

Pokud zatím není jasné, k čemu je API dobré a jak se liší od běžného webového chatu, viz Jak na ChatGPT (ale i jiné AI) přímo přes API? V čem je to jiné od webu/aplikace? Co to API vůbec znamená?. A pokud nechcete nic programovat, hodit se může i Klienti pro LLM přes API: jak pohodlně chatovat s libovolnou AI.

U vlastních programů počítejte také s tím, že free API dříve či později vrátí 429 Too Many Requests. Nestačí tedy jen umět požadavek odeslat. Aplikace by měla zvládat chybu, chvíli počkat a požadavek zopakovat, ideálně s postupně prodlužovanou prodlevou.

Limity se navíc nepočítají jen jako dotazy za minutu. Setkáte se například s RPM (requests per minute), RPD (requests per day), TPM (tokens per minute) nebo TPD (tokens per day).

NVIDIA NIM

Řeč už tu byla o NIM od NVIDIA a je k tomu samostatný tip NVIDIA umožňuje přístup k desítkám AI modelů převážně zdarma. Přes bezplatný NVIDIA Developer Program je možné používat modely z NVIDIA API Catalog a nabídka je opravdu rozsáhlá.

V praxi u řady endpointů narazíte zhruba na 40 požadavků za minutu. To samo o sobě není špatné, některé bezplatné modely ale umí být extrémně pomalé. Výhodou je naopak záplava modelů, takže můžete zkoušet DeepSeek, GLM, Qwen, Kimi, Llamu a řadu dalších bez nutnosti řešit každého poskytovatele zvlášť.

NVIDIA sama označuje tato bezplatná API jako API pro vývoj. Pokud potřebujete enterprise podporu, stabilitu API a další produkční vlastnosti, nabízí NVIDIA AI Enterprise.

Google AI Studio a Gemini API

Stejně tak už byla řeč o Google AI Studio, tedy Gemini. Podrobněji viz Gemini AI můžete přes API používat zdarma. Jak na to? A co když to přestane stačit?.

Google má Free tier s bezplatnými vstupními i výstupními tokeny pro vybrané modely a patří k nejzajímavějším možnostem pro obecné prototypování. Výhodou Gemini je i multimodalita, takže nejste omezeni jen na text.

Konkrétní rate limits závisí na modelu a projektu a Google je může měnit. Aktuální limity proto kontrolujte přímo v AI Studiu, ne podle několik měsíců starého článku nebo tabulky někde na Internetu.

Velký háček Google Free tieru je soukromí. Google u ceníku Gemini API výslovně uvádí, že obsah z bezplatného tieru může používat ke zlepšování svých produktů. U placeného tieru ne. Citlivá, osobní nebo neveřejná data proto přes bezplatné Gemini API neposílejte.

TIP: Compare Free LLM API Providers – Capabilities, Free Tiers & Notes je zajímavý rozcestník k dalším možnostem. Konkrétní limity a podmínky ale vždy ověřujte přímo u poskytovatele. Free tarify se mění rychle a ani podobné průběžně aktualizované seznamy nemusí stačit. V době psaní tohoto tipu tam například stále najdete už ukončené GitHub Models.

Rychlé srovnání

SlužbaCo dostanete zdarmaHlavní háček
NVIDIA NIMvelké množství modelů přes API Catalogrychlost a limity se liší podle modelu
Google Gemini APIFree tier vybraných Gemini modelůdata Free tieru mohou být používána ke zlepšování produktů
Groqskutečný Free planvýrazně rozdílné limity podle modelu
CerebrasFree tier až 1 milion tokenů denněomezený výběr modelů a měnící se limity
OpenRouter25+ free modelů přes jeden klíčstandardně jen 50 free dotazů denně
Cloudflare Workers AI10 000 Neurons denněNeurons nejsou totéž co tokeny
MistralFree mode bez platební kartynízké limity a u Free plánu je nutné hlídat použití dat
Coherebezplatný Trial API key1000 volání měsíčně a zákaz produkčního použití
SambaNovaFree Tier bez platební metodyu hlavních modelů jen 20 dotazů denně
Hugging Facemalý měsíční kredit0,10 USD je opravdu jen na experimentování

Konkrétní čísla v podobné tabulce berte jako momentální stav. U bezplatných AI API je změna limitu, modelu nebo celého tarifu běžná věc.

Groq

Groq je zajímavý hlavně rychlostí a tím, že má skutečný Free plan. Aktuální seznam modelů například uvádí Llama 3.3 70B kolem 280 tokenů/s, GPT-OSS 120B kolem 500 tokenů/s a GPT-OSS 20B kolem 1000 tokenů/s.

Limity Free planu se liší model od modelu. Llama 3.3 70B má například 30 RPM, 1000 požadavků denně a 100 000 tokenů denně. Menší Llama 3.1 8B dovoluje až 14 400 požadavků a 500 000 tokenů denně.

To je mimochodem dobrá ukázka, proč nemá příliš smysl hledat jedno číslo typu „kolik Groq dává zdarma“. Záleží na modelu a narazit můžete dřív na limit dotazů, tokenů nebo obojího.

Groq je zajímavý i z pohledu dat. Podle jeho pravidel pro práci s daty se vstupy a výstupy běžných inference požadavků standardně neuchovávají. Dočasně mohou být zaznamenány při řešení technických problémů nebo podezření na zneužití služby a k dispozici je také Zero Data Retention.

TIP: Praktické zkušenosti s vibe codingem zadarmo – OpenCode a free modely

Cerebras

Cerebras je další rychlostní extrém. GPT-OSS 120B podle aktuální nabídky modelů běží kolem 3000 tokenů/s.

Cerebras má skutečný Free tier. U GPT-OSS 120B je aktuální limit 1 milion tokenů denně, 30 požadavků za minutu a až 14 400 požadavků denně. U jiných modelů mohou být limity podstatně nižší, například GLM má momentálně jen 100 požadavků denně.

Cerebras se tedy hodí zejména tam, kde chcete zjistit, jak velký rozdíl udělá opravdu rychlá inference. Počet dostupných veřejných modelů je proti NVIDIA nebo OpenRouteru podstatně menší.

OpenRouter

OpenRouter je zajímavý něčím jiným – velkým množstvím modelů dostupných přes jeden klíč a prakticky stejné API.

Free plán nabízí přes 25 bezplatných modelů. Bez zakoupených kreditů máte dohromady 50 free požadavků denně a 20 za minutu. Pokud si koupíte alespoň 10 USD kreditů, stoupne denní limit free modelů na 1000 požadavků. Minutový strop zůstává 20.

Free model poznáte podle :free varianty. OpenRouter má také Free Models Router openrouter/free, který může některý právě dostupný bezplatný model vybrat automaticky.

Velkou výhodou OpenRouteru je fallback. Můžete určit několik modelů za sebou a pokud první narazí například na rate limit, výpadek nebo jinou chybu, OpenRouter zkusí další.

Pozor ale na jednu věc: fallbackem si nenásobíte bezplatný limit OpenRouteru. Free modely pořád sdílejí celkových 50, případně 1000 požadavků denně.

OpenRouter samotný podle dokumentace k práci s daty prompty a odpovědi standardně neukládá, pokud si ukládání nebo použití dat sami nezapnete. Požadavek ale pokračuje k poskytovateli konkrétního modelu a tam mohou platit jiná pravidla. Při práci s citlivými daty je proto potřeba kontrolovat i konkrétního providera, přes kterého OpenRouter požadavek pošle.

LiteLLM a fallback mezi různými poskytovateli

Pokud chcete skládat za sebe různé poskytovatele a jejich vlastní API klíče, zajímavý je LiteLLM. Nabízí jednotné OpenAI kompatibilní rozhraní pro více než stovku LLM služeb a Router s retry a fallbackem mezi různými deploymenty.

Můžete tak například nejdřív použít Groq, po dosažení jeho limitu přejít na Mistral a potom na NVIDIA. Každá služba přitom používá svůj vlastní účet, API klíč a vlastní limity.

To samozřejmě není návod k zakládání několika účtů u stejného poskytovatele kvůli obcházení jeho omezení.

Cloudflare Workers AI

Cloudflare Workers AI dává největší smysl, pokud už používáte Cloudflare Workers, Pages nebo další části jeho infrastruktury.

Free i Paid Workers mají 10 000 Neurons denně zdarma. Na Free plánu po vyčerpání denní alokace další požadavky přestanou fungovat.

Pozor na jednotku. „Neuron“ je účtovací jednotka Cloudflare vyjadřující spotřebovaný výpočetní výkon. Není to token, takže 10 000 Neurons nejde jednoduše porovnat s milionem tokenů u Cerebras.

Cloudflare má v katalogu desítky modelů včetně Llama, Qwen, DeepSeek, Mistral, GPT-OSS, GLM nebo Kimi a vedle textu také modely pro embeddings, obrázky či audio.

GitHub Models už neexistuje

GitHub Models už jako možnost neberte. GitHub tuto službu 30. července 2026 kompletně ukončil. Skončil playground, katalog modelů, inference API i BYOK.

Starší návody a seznamy free API ho přesto mohou stále uvádět. GitHub už místo něj odkazuje na Microsoft Foundry nebo GitHub Copilot.

Mistral

Mistral má skutečný Free mode bez platební karty. Podle dokumentace Mistral Studio je API ve Free mode aktivní automaticky, stačí vytvořit API klíč. Použití a rate limits jsou omezené.

Konkrétní limity se zobrazují podle účtu a mohou se měnit, takže nemá velký smysl zapisovat sem pevné číslo.

Pozor ale na data. U Free plánu mohou být vstupy a výstupy z API použity k trénování modelů. V Admin Console je možné použití dat vypnout přes Privacy -> Anonymous improvement data. Po vypnutí Mistral API volání a související data pro zlepšování svých služeb nepoužívá.

Cohere

Cohere stojí za zmínku hlavně pro zkoušení jeho Command modelů, embeddings a rerankingu. Každý účet začíná s bezplatným Trial API key.

Trial klíče mají limit 1000 API volání měsíčně. Chat modely mají typicky ještě limit 20 požadavků za minutu.

Tady je ale podstatný rozdíl proti některým ostatním službám. Cohere výslovně uvádí, že Trial API key není povolený pro produkční ani komerční použití. Pro produkci potřebujete placený Production API key.

Také sem neposílejte osobní nebo citlivé údaje. Cohere u Trial Users uvádí, že shromažďuje vstupy a výstupy a může je používat pro výzkum, vývoj a zlepšování svých produktů.

SambaNova Cloud

SambaNova Cloud má Free Tier automaticky tehdy, pokud k účtu není připojená platební metoda.

Výběr modelů je menší, ale najdete tam například Llama 3.3 70B, GPT-OSS 120B nebo DeepSeek. Aktuální Free Tier limity jsou u hlavních modelů 20 požadavků za minutu, 20 požadavků za den a 200 000 tokenů denně.

Právě těch 20 dotazů denně dělá ze SambaNova spíš službu na testování jednotlivých promptů nebo kompatibility než backend pro něco, co budete používat průběžně.

Hugging Face Inference Providers

Hugging Face Inference Providers je trochu jiný případ. Hugging Face funguje jako společná vrstva nad řadou inference providerů a přes jednotné rozhraní zpřístupňuje přes 200 modelů.

Běžný Free účet ale momentálně dostává pouze 0,10 USD kreditu měsíčně, přičemž Hugging Face výslovně upozorňuje, že se tato částka může změnit.

To je opravdu jen na několik pokusů. Výhoda je spíš v možnosti snadno zjistit, zda daný model nebo provider vyhovuje, než v dlouhodobém používání zdarma.

Při použití Hugging Face navíc nezapomínejte, že inference může probíhat u externího providera. Pravidla práce s daty tedy mohou záviset i na něm.

Co tedy použít

Pro obecné prototypování je velmi použitelný Google AI Studio/Gemini, pokud nevadí jeho pravidla práce s daty ve Free tieru. Pro rychlost je výborný Groq a ještě dál jde Cerebras. Pokud je důležitý velký výběr modelů a routing, dává smysl OpenRouter. NVIDIA NIM je silný hlavně záplavou čerstvých open-weight modelů na jednom místě.

Pokud z pokusu může později vzniknout něco používaného pravidelně, není dobré aplikaci navázat natvrdo na jediný bezplatný endpoint. OpenAI kompatibilní rozhraní nebo vrstva typu LiteLLM umožní model či poskytovatele později změnit podstatně snadněji.

Free API jsou výborná laboratoř pro zkoušení modelů, promptů a vlastních programů. Jako infrastruktura, na kterou se potřebujete dlouhodobě spolehnout, už podstatně méně.