FFlauron
AI Engineer: LLM-додатки, RAG, агенти
Безкоштовний урок-прев'ю

Сучасний LLM-стек 2026: моделі, API, ціноутворення

AI Engineer 2026 — це не "людина, що тренує моделі". Тренують моделі OpenAI / Anthropic / Meta. Ти як AI Engineer збираєш з цих моделей продукти: чат-боти, асистенти, агенти, code-tools. Знаєш, коли треба RAG, коли fine-tune, коли prompt engineering вистачить — і скільки це коштує.

Чим AI Engineer відрізняється

Роль Що робить
ML Engineer Тренує/деплоїть моделі. Знає PyTorch, статистику, дистрибутивне навчання
Data Scientist Аналіз, моделі, інсайти з даних
AI Engineer Інтегрує LLM у продукти. API, prompts, RAG, agents, evals
Prompt Engineer Sub-niche AI Engineer'а: тільки промпти

Якщо в твоєму резюме «використовував OpenAI API, написав RAG, налаштував evaluations» — ти AI Engineer. Зарплати в УА — $2-5k для middle, $5-10k для senior.

Топ моделей у травні 2026

Сім'я Топ-моделі Сильна сторона
Anthropic Claude claude-opus-4-7, claude-sonnet-4-6, claude-haiku-4-5 Найкраще в коді, long context (200k), structured output
OpenAI GPT gpt-4o, gpt-4o-mini, o3, o3-mini Реазонінг (o-серія), tool calling, function calling
Google Gemini gemini-2.5-pro, gemini-flash Multi-modal, 1M+ context window
Open-weights Llama 3.3, Mistral Large, Qwen 2.5 Self-host, без API-залежності

Best practice: не клейся до одного провайдера. Абстракція над API дозволяє переключати моделі під задачу (cost vs quality).

Latency tiers (важливо для UX)

Tier Latency Use case Моделі
Fast <1 сек autocomplete, классифікація Haiku, gpt-4o-mini, Gemini Flash
Standard 1-5 сек чат, RAG Sonnet, gpt-4o
Reasoning 10-60 сек складна логіка, math, code Opus, o3

Не запускай Opus для класифікації — Haiku в 10 разів дешевше і в 5 разів швидше з тим же результатом на простих задачах.

Ціноутворення — критично

Усі API беруть per token окремо за input/output. Output дорожчий в 3-5 разів за input.

Орієнтири (травень 2026, $ / 1M токенів):

Модель Input Output
gpt-4o-mini $0.15 $0.60
gpt-4o $2.50 $10.00
o3-mini $3.00 $12.00
claude-haiku-4-5 $0.80 $4.00
claude-sonnet-4-6 $3.00 $15.00
claude-opus-4-7 $15.00 $75.00

Що це означає на практиці:

  • 1000 запитів до Sonnet з 2k input + 1k output ≈ $21
  • Той самий 1000 запитів до Haiku ≈ $5.60
  • На опус ≈ $105

Контролюй вибір моделі на API — інакше cloud bill стане сюрпризом.

Базовий приклад — OpenAI

from openai import OpenAI

client = OpenAI()  # читає OPENAI_API_KEY з env

resp = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "Ти експерт з Python."},
        {"role": "user", "content": "Як працює GIL?"},
    ],
    temperature=0.3,
    max_tokens=500,
)

print(resp.choices[0].message.content)
print(f"Used {resp.usage.total_tokens} tokens "
      f"({resp.usage.prompt_tokens} in + {resp.usage.completion_tokens} out)")

Базовий приклад — Anthropic

import anthropic

client = anthropic.Anthropic()

msg = client.messages.create(
    model="claude-sonnet-4-6",
    max_tokens=500,
    system="Ти експерт з Python.",
    messages=[
        {"role": "user", "content": "Як працює GIL?"},
    ],
)

print(msg.content[0].text)
print(f"Input: {msg.usage.input_tokens}, Output: {msg.usage.output_tokens}")

Концепції ті самі, API-стиль трохи різний. Anthropic — messages, system як параметр; OpenAI — messages зі spec system всередині.

Token — це не слово

LLM не «бачать» текст — вони бачать токени. 1 токен ≈ 4 символи англ, ≈ 1-2 символи укр.

import tiktoken

enc = tiktoken.encoding_for_model("gpt-4o")
print(len(enc.encode("Hello, world!")))  # 4 tokens
print(len(enc.encode("Привіт, світе!")))  # ~10 tokens — кирилиця дорожча!

Українська коштує в 2-3 рази більше токенів за англійську. Якщо економіш — пиши system-prompt англійською (модель розуміє), а контент — на тій мові, що треба клієнту.

Context window

Скільки моделі можна "запхати" одночасно (system + history + новий запит + output).

  • gpt-4o-mini: 128k
  • Sonnet 4.6: 200k
  • Gemini 2.5: 1M-2M

200k токенів ≈ 500 сторінок тексту. Здається багато, але:

  • Чат-історія росте лінійно
  • RAG-документи додають швидко
  • Опрацювання довгих контекстів дорожче і повільніше

Правило: чим менше контексту, тим краще. Стискай, обрізай, summarize-уй.

Temperature

  • 0 — детерміновано. Та сама відповідь на той самий запит. Для класифікації, extraction, code.
  • 0.3-0.7 — баланс. Чати, відповіді на питання.
  • 0.7-1.0 — креатив. Тексти, ідеї, бренштормінг.
  • >1.0 — chaos. Рідко корисно.

Streaming — must для UX

Користувач НЕ повинен чекати 30 секунд. Стримінг → перші токени з'являються за 200мс:

stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[...],
    stream=True,
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

У вебі — Server-Sent Events або WebSocket. Чат без стримінгу виглядає поламано в 2026.

Async для масштабу

from openai import AsyncOpenAI
import asyncio

client = AsyncOpenAI()

async def ask(question: str) -> str:
    resp = await client.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )
    return resp.choices[0].message.content

questions = ["що таке RAG?", "що таке Spark?", "що таке Kafka?"]
answers = asyncio.run(asyncio.gather(*[ask(q) for q in questions]))

3 паралельні запити — у 3 рази швидше за послідовні.

Rate limits — головний біль

API провайдери лімітують:

  • RPM (requests per minute)
  • TPM (tokens per minute)
  • TPD (tokens per day)

Tier 1 на OpenAI: 500 RPM, 200k TPM. Senior tier: 5000 RPM, 10M TPM. Платиш більше — отримуєш вищий tier.

При 429-помилці — exponential backoff retry. Бібліотеки SDK роблять це автоматично, але налаштуй retry policy.

Що ти отримаєш у курсі

Через 15 модулів зможеш:

  • Будувати RAG-системи (Q&A по документах)
  • Робити agents з tools (доступ до DB, API, файлів)
  • Налаштовувати evaluation pipelines (як перевірити, що працює)
  • Оптимізувати cost і latency на проді
  • Захищати від prompt injection і data leakage
  • Деплоїти production-grade AI-сервіси

Capstone — повноцінний AI-чат-бот з RAG, агентами, eval-ами і деплоєм.

Тест: перевір себе

  1. У чому різниця AI Engineer і ML Engineer?
  2. Чому output-токени дорожчі за input?
  3. Що таке context window?
  4. Коли temperature=0, коли temperature=0.7?
  5. Чому стримінг — must для чату?
Відповіді
  1. ML Engineer тренує/деплоїть моделі (PyTorch, дистрибутивне навчання). AI Engineer інтегрує готові LLM (OpenAI, Anthropic) у продукти через API: prompts, RAG, agents, evaluation. Перетин є, але фокус різний — ML побудовою моделей, AI Engineer — додатками.
  2. Generation — авторегресивна: модель генерує токен за токеном (forward pass за кожен). Input можна обробити paralelно (batch attention). Output — sequential, дорожчий за compute. Тому інші ціни — реальна вартість для провайдера.
  3. Скільки токенів модель тримає одночасно: system + history + новий запит + output. Перевищиш — помилка або обрізає старе. У Sonnet 4.6 — 200k. Чим більший контекст, тим дорожче і повільніше (квадратичне зростання attention).
  4. 0 — детерміновано: classification, extraction, code (хочеш той самий результат щоразу). 0.3-0.7 — баланс: чати, Q&A. >0.7 — креатив: ідеї, тексти. Для tasks типу «витягни ім'я з тексту» — завжди 0.
  5. Без стримінгу 5-30 секунд німого чекання — користувачі думають, що сервіс зламався. Зі стримінгом перші токени через 200мс — UX як у ChatGPT. У 2026 — стандарт, відсутність = bad product.

Сподобався урок?

Придбайте повний курс, щоб отримати доступ до всіх уроків.

Перейти до курсу