LLM'lerin en büyük zaafı: eğitim datasından sonra olan olayları bilmiyor + senin özel verilerini hiç görmemiş. RAG (Retrieval Augmented Generation), bu sorunu çözer — soru gelince önce ilgili dokümanı bulup AI'a verir, sonra cevaplatır.
Klasik LLM vs RAG
- Klasik LLM
- Sadece eğitim datasından yanıt verir. Hallucination yüksek.
- RAG
- Önce bilgi bankasından ilgili dokümanlar bul, sonra onu kullanarak yanıt ver. Doğruluk yüksek.
RAG mimarisi — 5 katman
- 01Document ingestion — kaynak dokümanları (PDF, web, DB) içe al
- 02Chunking — dokümanları 200-500 kelimelik parçalara böl
- 03Embedding — her parçayı vektör (embedding) olarak temsil et
- 04Vector storage — vektörleri vector database'e kaydet
- 05Query + Generation — soru gelince benzer vektörleri bul → LLM'e bağlam ver → cevap üret
Embedding modeli seçimi
- OpenAI text-embedding-3-small — $0.02/1M token, hızlı
- OpenAI text-embedding-3-large — daha doğru, $0.13/1M
- Cohere embed-v3 — multi-language güçlü, Türkçe iyi
- Voyage AI — modern alternatif, embedding kalitesi yüksek
- Open-source (BGE, E5) — kendi sunucunda çalıştır, ücretsiz
Vector database seçenekleri
- Pinecone
- Managed cloud, kolay başlangıç. Free tier mevcut.
- Chroma
- Open source, lokal/self-host. Geliştirici dostu.
- Qdrant
- Open source + cloud. Rust performans.
- Weaviate
- Hybrid search (vector + keyword).
- pgvector (PostgreSQL)
- Mevcut Postgres'inize ekle. Ek altyapı yok.
- Milvus
- Büyük ölçekli production.
Chunking stratejileri
- Fixed size — her 500 token bir chunk
- Recursive — paragraf → cümle → kelime hiyerarşik bölme
- Semantic — anlam birimine göre böl (LLM ile)
- Metadata-aware — başlık + içerik ayrımı
- Overlap — chunk'lar arası 10-20% örtüşme bağlamı korur
Gerçek kullanım örnekleri
Müşteri destek chatbot
Bilgi bankası (FAQ, dökümantasyon, ürün rehberleri) RAG'e yüklenir. Müşteri soru sorduğunda chatbot kendi dökümandan cevap üretir. Hallucination ihtimali %90 düşer.
İç şirket asistanı
HR politikaları, prosedür dokümanları, geçmiş projeler RAG'e konur. Çalışan "yıllık izin politikası nedir?" diye sorduğunda gerçek doküman üzerinden yanıt alır.
E-ticaret ürün araması
Klasik keyword search yerine semantic search. "sıcak tutan kış montu" sorgusu "polar dış cephe, içi kürk astar" ürünü bulur — keyword olmasa bile.
İçerik öneri sistemi
Blog yazılarını embed et, kullanıcı yazıyı okurken benzer içerikleri öner. Klasik kategori-tag tabanlı önerilerden %30-50 daha alakalı.
RAG vs Fine-tuning
- RAG — bilgi dinamik, sık değişiyor. Yeni doküman ekle, anında bilir.
- Fine-tuning — domain-specific dil/ton/format. Pahalı, statik.
- Hibrit — Fine-tuned base + RAG yaklaşımı en güçlü
Maliyet hesabı (örnek)
10K dokümanlık bilgi bankası: Embedding ~$30 (tek seferlik). Vector DB Pinecone Starter ücretsiz (5M vector kadar). Query başına embedding $0.0001 + LLM call $0.003 = ~$0.003/soru. Aylık 50K soru için $150 toplam maliyet.
Şunu yapmayın: RAG'i model fine-tuning yerine kabul etmek
RAG bilgi sağlar, ton/marka voice'unu öğretmez. Müşteri yanıtı için "resmi ton" gerekiyorsa system prompt + few-shot lazım — RAG tek başına çözmez.
NotŞirketiniz için RAG sistemi kurulumu: +90 537 729 40 97 (WhatsApp). Bilgi bankası analiz + 30 günlük pilot canlıya.