LLM API entegrasyonu, AI'ı kendi ürününüze gömme yolu. Müşteri destek widget, otomatik içerik üretim, AI özet — uygulamanızdaki herhangi bir yere AI yetenek eklenir. Bu rehberde 2026 itibarıyla 3 büyük sağlayıcının pratik kullanımı.
Sağlayıcı karşılaştırması
- OpenAI
- En popüler, en geniş ekosistem. GPT-4o, GPT-4 mini.
- Anthropic
- Claude 4.7 Sonnet/Opus. 200K context, kod + analiz güçlü.
- Gemini 2.5 Pro/Flash. Google Search entegre, ucuz.
- Mistral
- Avrupa menşeli, açık ağırlıklı modeller.
- Cohere
- Enterprise, multi-language
Fiyat karşılaştırması (Mayıs 2026)
- GPT-4o mini
- $0.15/1M input, $0.60/1M output
- GPT-4o
- $2.50/1M input, $10/1M output
- Claude Sonnet 4.7
- $3/1M input, $15/1M output
- Claude Opus 4.7
- $15/1M input, $75/1M output
- Gemini 2.5 Flash
- $0.10/1M input, $0.40/1M output
- Gemini 2.5 Pro
- $1.25/1M input, $5/1M output
İlk request — OpenAI örneği
```javascript import OpenAI from 'openai'; const client = new OpenAI({ apiKey: process.env.OPENAI_API_KEY }); const response = await client.chat.completions.create({ model: 'gpt-4o', messages: [ { role: 'system', content: 'Sen SEO uzmanısın' }, { role: 'user', content: 'Title tag için önerilerin?' } ] }); console.log(response.choices[0].message.content); ```
Function calling (tool use)
LLM'in dış araçları çağırmasına izin verir. "Hava nasıl?" sorusu LLM'in `getWeather()` fonksiyonunu çağırmasını tetikler, sonra gerçek veri ile yanıt verir. OpenAI ve Anthropic native destekliyor. Modern AI agent'ların kalbi.
Streaming responses
Tüm yanıt bitmeden token token gönderim. Kullanıcı yanıtı yazılıyormuş gibi görür — UX dramatically iyileşir. ChatGPT UI'ında gördüğümüz "yazıyor..." efekti streaming'dir. `stream: true` flag ile aktive.
Prompt caching
Anthropic 2024 sonu sundu, OpenAI ve Gemini 2025'te ekledi. Aynı uzun prompt'un tekrarlanan bölümlerini cache'ler — sonraki istekler %90 ucuz. Uzun system prompt + RAG context kullanımında ekonomik.
Embedding API
Vector üretim için ayrı endpoint. OpenAI text-embedding-3-small ($0.02/1M token), Voyage AI, Cohere alternatifler. Embedding modeli mutlaka aynı kullanılmalı — query ve doküman aynı modelden vector almalı.
Rate limit ve quota
- Yeni hesap tier 1 — saniyede 3-5 istek
- $50 ön ödeme sonra tier 2 — 60 istek/dk
- $500 sonra tier 4 — 5K istek/dk
- Production app için tier 3+ gerek
- Rate limit aşılırsa 429 status, exponential backoff retry
Error handling
- 429 — rate limit (retry)
- 500/503 — server error (retry)
- 401 — auth (API key kontrol)
- 400 — bad request (prompt format hatası)
- Content filter — politika ihlali (alternatif prompt)
Maliyet kontrol stratejileri
- 01Doğru model seç — basit iş için GPT-4o mini, karmaşık için Opus
- 02Max tokens limit — beklenenden uzun yanıt önle
- 03Prompt caching aktif
- 04Streaming kullan — kullanıcı erken durdurabilir
- 05Async batch API — gecikme önemsizse %50 indirim
- 06Aylık budget alert
Multi-provider strategy
Production'da tek sağlayıcıya bağımlı kalmak risk. LiteLLM, LangChain gibi abstraction layer ile birden fazla LLM arasında kolay geçiş. Failover: primary sağlayıcı düşerse backup'a geç. Cost optimization: maliyet/kalite/hız öncelikleriyle dinamik routing.
Veri güvenliği
- API kullanımında veri model eğitiminde KULLANILMAZ (default)
- Enterprise tier — SOC2, HIPAA compliance
- EU veri merkezi — Anthropic + OpenAI Avrupa option
- On-prem alternatif — Ollama + Llama 3.3 ile local çalıştır
- API key rotation — 90 günde bir yenile
Şunu yapmayın: API key'i frontend kodda saklamak
API key client-side koda gömülürse anyone DevTools'ta görür → sınırsız ücretsiz erişim kazanır. Her zaman backend proxy üzerinden çağrı yap, API key sunucuda kalsın.
NotLLM API entegrasyonu + custom AI feature: +90 537 729 40 97 (WhatsApp). 14 gün MVP, 30 gün ölçek.