Сучасний LLM-стек 2026: моделі, API, ціноутворення
AI Engineer 2026 — це не "людина, що тренує моделі". Тренують моделі OpenAI / Anthropic / Meta. Ти як AI Engineer збираєш з цих моделей продукти: чат-боти, асистенти, агенти, code-tools. Знаєш, коли треба RAG, коли fine-tune, коли prompt engineering вистачить — і скільки це коштує.
Чим AI Engineer відрізняється
| Роль | Що робить |
|---|---|
| ML Engineer | Тренує/деплоїть моделі. Знає PyTorch, статистику, дистрибутивне навчання |
| Data Scientist | Аналіз, моделі, інсайти з даних |
| AI Engineer | Інтегрує LLM у продукти. API, prompts, RAG, agents, evals |
| Prompt Engineer | Sub-niche AI Engineer'а: тільки промпти |
Якщо в твоєму резюме «використовував OpenAI API, написав RAG, налаштував evaluations» — ти AI Engineer. Зарплати в УА — $2-5k для middle, $5-10k для senior.
Топ моделей у травні 2026
| Сім'я | Топ-моделі | Сильна сторона |
|---|---|---|
| Anthropic Claude | claude-opus-4-7, claude-sonnet-4-6, claude-haiku-4-5 | Найкраще в коді, long context (200k), structured output |
| OpenAI GPT | gpt-4o, gpt-4o-mini, o3, o3-mini | Реазонінг (o-серія), tool calling, function calling |
| Google Gemini | gemini-2.5-pro, gemini-flash | Multi-modal, 1M+ context window |
| Open-weights | Llama 3.3, Mistral Large, Qwen 2.5 | Self-host, без API-залежності |
Best practice: не клейся до одного провайдера. Абстракція над API дозволяє переключати моделі під задачу (cost vs quality).
Latency tiers (важливо для UX)
| Tier | Latency | Use case | Моделі |
|---|---|---|---|
| Fast | <1 сек | autocomplete, классифікація | Haiku, gpt-4o-mini, Gemini Flash |
| Standard | 1-5 сек | чат, RAG | Sonnet, gpt-4o |
| Reasoning | 10-60 сек | складна логіка, math, code | Opus, o3 |
Не запускай Opus для класифікації — Haiku в 10 разів дешевше і в 5 разів швидше з тим же результатом на простих задачах.
Ціноутворення — критично
Усі API беруть per token окремо за input/output. Output дорожчий в 3-5 разів за input.
Орієнтири (травень 2026, $ / 1M токенів):
| Модель | Input | Output |
|---|---|---|
| gpt-4o-mini | $0.15 | $0.60 |
| gpt-4o | $2.50 | $10.00 |
| o3-mini | $3.00 | $12.00 |
| claude-haiku-4-5 | $0.80 | $4.00 |
| claude-sonnet-4-6 | $3.00 | $15.00 |
| claude-opus-4-7 | $15.00 | $75.00 |
Що це означає на практиці:
- 1000 запитів до Sonnet з 2k input + 1k output ≈ $21
- Той самий 1000 запитів до Haiku ≈ $5.60
- На опус ≈ $105
Контролюй вибір моделі на API — інакше cloud bill стане сюрпризом.
Базовий приклад — OpenAI
from openai import OpenAI
client = OpenAI() # читає OPENAI_API_KEY з env
resp = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "Ти експерт з Python."},
{"role": "user", "content": "Як працює GIL?"},
],
temperature=0.3,
max_tokens=500,
)
print(resp.choices[0].message.content)
print(f"Used {resp.usage.total_tokens} tokens "
f"({resp.usage.prompt_tokens} in + {resp.usage.completion_tokens} out)")
Базовий приклад — Anthropic
import anthropic
client = anthropic.Anthropic()
msg = client.messages.create(
model="claude-sonnet-4-6",
max_tokens=500,
system="Ти експерт з Python.",
messages=[
{"role": "user", "content": "Як працює GIL?"},
],
)
print(msg.content[0].text)
print(f"Input: {msg.usage.input_tokens}, Output: {msg.usage.output_tokens}")
Концепції ті самі, API-стиль трохи різний. Anthropic — messages, system як параметр; OpenAI — messages зі spec system всередині.
Token — це не слово
LLM не «бачать» текст — вони бачать токени. 1 токен ≈ 4 символи англ, ≈ 1-2 символи укр.
import tiktoken
enc = tiktoken.encoding_for_model("gpt-4o")
print(len(enc.encode("Hello, world!"))) # 4 tokens
print(len(enc.encode("Привіт, світе!"))) # ~10 tokens — кирилиця дорожча!
Українська коштує в 2-3 рази більше токенів за англійську. Якщо економіш — пиши system-prompt англійською (модель розуміє), а контент — на тій мові, що треба клієнту.
Context window
Скільки моделі можна "запхати" одночасно (system + history + новий запит + output).
- gpt-4o-mini: 128k
- Sonnet 4.6: 200k
- Gemini 2.5: 1M-2M
200k токенів ≈ 500 сторінок тексту. Здається багато, але:
- Чат-історія росте лінійно
- RAG-документи додають швидко
- Опрацювання довгих контекстів дорожче і повільніше
Правило: чим менше контексту, тим краще. Стискай, обрізай, summarize-уй.
Temperature
- 0 — детерміновано. Та сама відповідь на той самий запит. Для класифікації, extraction, code.
- 0.3-0.7 — баланс. Чати, відповіді на питання.
- 0.7-1.0 — креатив. Тексти, ідеї, бренштормінг.
- >1.0 — chaos. Рідко корисно.
Streaming — must для UX
Користувач НЕ повинен чекати 30 секунд. Стримінг → перші токени з'являються за 200мс:
stream = client.chat.completions.create(
model="gpt-4o-mini",
messages=[...],
stream=True,
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
У вебі — Server-Sent Events або WebSocket. Чат без стримінгу виглядає поламано в 2026.
Async для масштабу
from openai import AsyncOpenAI
import asyncio
client = AsyncOpenAI()
async def ask(question: str) -> str:
resp = await client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": question}],
)
return resp.choices[0].message.content
questions = ["що таке RAG?", "що таке Spark?", "що таке Kafka?"]
answers = asyncio.run(asyncio.gather(*[ask(q) for q in questions]))
3 паралельні запити — у 3 рази швидше за послідовні.
Rate limits — головний біль
API провайдери лімітують:
- RPM (requests per minute)
- TPM (tokens per minute)
- TPD (tokens per day)
Tier 1 на OpenAI: 500 RPM, 200k TPM. Senior tier: 5000 RPM, 10M TPM. Платиш більше — отримуєш вищий tier.
При 429-помилці — exponential backoff retry. Бібліотеки SDK роблять це автоматично, але налаштуй retry policy.
Що ти отримаєш у курсі
Через 15 модулів зможеш:
- Будувати RAG-системи (Q&A по документах)
- Робити agents з tools (доступ до DB, API, файлів)
- Налаштовувати evaluation pipelines (як перевірити, що працює)
- Оптимізувати cost і latency на проді
- Захищати від prompt injection і data leakage
- Деплоїти production-grade AI-сервіси
Capstone — повноцінний AI-чат-бот з RAG, агентами, eval-ами і деплоєм.
Тест: перевір себе
- У чому різниця AI Engineer і ML Engineer?
- Чому output-токени дорожчі за input?
- Що таке context window?
- Коли temperature=0, коли temperature=0.7?
- Чому стримінг — must для чату?
Відповіді
- ML Engineer тренує/деплоїть моделі (PyTorch, дистрибутивне навчання). AI Engineer інтегрує готові LLM (OpenAI, Anthropic) у продукти через API: prompts, RAG, agents, evaluation. Перетин є, але фокус різний — ML побудовою моделей, AI Engineer — додатками.
- Generation — авторегресивна: модель генерує токен за токеном (forward pass за кожен). Input можна обробити paralelно (batch attention). Output — sequential, дорожчий за compute. Тому інші ціни — реальна вартість для провайдера.
- Скільки токенів модель тримає одночасно: system + history + новий запит + output. Перевищиш — помилка або обрізає старе. У Sonnet 4.6 — 200k. Чим більший контекст, тим дорожче і повільніше (квадратичне зростання attention).
- 0 — детерміновано: classification, extraction, code (хочеш той самий результат щоразу). 0.3-0.7 — баланс: чати, Q&A. >0.7 — креатив: ідеї, тексти. Для tasks типу «витягни ім'я з тексту» — завжди 0.
- Без стримінгу 5-30 секунд німого чекання — користувачі думають, що сервіс зламався. Зі стримінгом перші токени через 200мс — UX як у ChatGPT. У 2026 — стандарт, відсутність = bad product.