RAG po polsku - kiedy chatbot na własnych danych ma sens
Co to jest RAG - w prostym języku
RAG to skrót od „Retrieval-Augmented Generation". W praktyce: LLM (jak ChatGPT) z dostępem do Twojej bazy wiedzy. Pytasz, system najpierw szuka w Twoich dokumentach, znajduje powiązane fragmenty, podaje je modelowi LLM jako kontekst, model odpowiada na podstawie tego kontekstu.
Po co to? Dwie rzeczy: 1) ChatGPT/Claude nie znają Twojej firmy, RAG daje im taką wiedzę. 2) RAG redukuje halucynacje, bo model odpowiada na podstawie konkretnych dokumentów, a nie z głowy.
Kiedy RAG ma sens - i kiedy nie
Tak, RAG:
Masz 50+ dokumentów, o które ludzie często pytają (regulaminy, procedury, instrukcje produktowe, FAQ rozszerzone). Chcesz zrobić chatbota, który odpowiada precyzyjnie z cytowaniem źródła. Dokumenty często się zmieniają - RAG aktualizuje się automatycznie po aktualizacji dokumentu.
Nie, RAG to przerost formy:
Masz 5 dokumentów PDF - wystarczy Claude Projects (po prostu wgrywasz pliki, gotowe). Pytania są ogólne („jak działa marketing") - ChatGPT odpowie bez RAG. Dokumenty rzadko się zmieniają i mieszczą się w 200 tys. tokenach (tj. ~100-200 stron) - wystarczy wgrać do prompta.
Architektura RAG - uproszczona
1. Indeksowanie (raz / przy aktualizacjach)
Dokumenty (PDF, DOCX, strony www) → ekstrakcja tekstu → chunking (dzielisz na fragmenty 500-1000 znaków) → embedding (każdy fragment dostaje wektor liczbowy reprezentujący znaczenie) → zapis do bazy wektorowej (Pinecone, Qdrant, Weaviate, Chroma).
2. Zapytanie (przy każdym pytaniu)
Pytanie użytkownika → embedding pytania → wyszukiwanie wektorowe w bazie (znajduje 5 najbardziej podobnych semantycznie fragmentów) → fragmenty + pytanie → LLM (Claude/GPT) → odpowiedź z cytatami.
3. Iteracja
Monitorowanie odpowiedzi, opinie użytkowników, dostrajanie chunkingu i promptów.
Polski kontekst - specyfika
Tokenizacja polskiego
Polskie słowa są znacznie dłuższe w tokenach niż angielskie (przez fleksję, długie wyrazy złożone). To znaczy: ten sam dokument w polskim zajmuje 1,5-2 razy więcej tokenów. Wpływa to na koszty (więcej tokenów = drożej) i limity kontekstu.
Embeddingi dla polskiego
OpenAI text-embedding-3-large działa świetnie dla polskiego. Cohere multilingual też. Dla budżetowych projektów: BGE-M3 (open-source, można uruchomić lokalnie). Dla profesjonalnych - OpenAI lub Cohere.
Pułapki specyficzne dla polskiego
Synonimy w polskim (np. „faktura" / „dokument księgowy" / „rachunek") czasem nie są wychwytywane przez wyszukiwanie. Sposób: wyszukiwanie hybrydowe - połączenie wyszukiwania po embeddingach z wyszukiwaniem po słowach kluczowych (BM25). Daje 20-40% lepsze wyniki w polskim niż czyste wyszukiwanie wektorowe.
Zestaw budżetowy kontra profesjonalny
Budżetowy (do 50 000 PLN łącznie)
Vector DB: Chroma lub Qdrant self-hosted. Embeddings: OpenAI text-embedding-3-small. LLM: Claude Sonnet (taniej niż Opus). Frontend: Streamlit lub Vercel Next.js. Czas wdrożenia: 3-4 tygodnie. Sensowne dla bazy do 5 000 dokumentów.
Profesjonalny (50 000 - 200 000 PLN)
Vector DB: Pinecone lub Qdrant managed. Embeddings: OpenAI text-embedding-3-large + reranker (Cohere Rerank). LLM: Claude Opus. Hybrid search (vector + BM25). Backend: FastAPI/Node.js. Frontend: własny interfejs z brandingiem firmy. Monitoring i analityka. Obsługa wielu klientów (multi-tenant). Czas: 8-16 tygodni.
5 najczęstszych zastosowań w polskich firmach
1. Wewnętrzny chatbot procedur
Wdrożenie nowych pracowników, FAQ procedur HR, instrukcje IT. Q&A na firmowym podręczniku. Adopcja: po wdrożeniu HR i IT odpowiadają o połowę mniej na powtarzające się pytania.
2. Chatbot dla klientów z FAQ
Strona produktu B2B SaaS - chatbot odpowiada na pytania techniczne na podstawie dokumentacji. Wzrost konwersji o 8-15% (klienci znajdują odpowiedzi szybciej).
3. Wsparcie sprzedaży
Handlowiec dostaje zapytanie od klienta o specyfikację techniczną. Wewnętrzny chatbot z dostępem do specyfikacji, studiów przypadków, polityk → handlowiec ma odpowiedź w 30 sekund.
4. Wyszukiwanie prawne i zgodność
Kancelaria z bazą orzeczeń, regulacji, opinii. Junior pyta „jakie były podobne sprawy o X" → RAG odpowiada z cytatami. (Z weryfikacją przez starszego prawnika, oczywiście.)
5. Wewnętrzna baza wiedzy
Firma 50+ osób z dziesiątkami dokumentów na Confluence/Notion/Drive. RAG łączy wszystko w jeden chatbot. Notion AI robi to do pewnego stopnia, własny RAG dla większych baz i bardziej zaawansowanych potrzeb.
Pułapki, które kosztują
1. Śmieci na wejściu, śmieci na wyjściu
RAG na chaotycznej, nieprzefiltrowanej bazie (stare dokumenty, duplikaty, sprzeczne wersje) daje chaotyczne odpowiedzi. Pierwszy etap projektu: czyszczenie danych. To zwykle 30-40% całej pracy.
2. Brak monitoringu
RAG odpowiada źle, nikt nie sprawdza. Klient pyta o coś technicznego, dostaje halucynację. Plan: log każdej odpowiedzi, okresowy przegląd przez człowieka, pętla informacji zwrotnej.
3. Przekombinowanie
Firmy chcą własnego RAG, kiedy Notion AI lub Claude Projects wystarczają. Test przed budową: spróbuj przez tydzień zrobić to gotowymi narzędziami. Jeśli wystarczą - nie buduj własnego.
4. Brak ścieżki eskalacji
Chatbot nie zna odpowiedzi → halucynuje. Dobry RAG ma odpowiedź awaryjną: „nie znalazłem w mojej bazie, oto kontakt do specjalisty".
RAG kontra Notion AI kontra Claude Projects
Claude Projects: do 200k tokenów dokumentów, łatwe (przeciągnij i upuść), świetne dla małych baz. Limit: nie skaluje się powyżej kilkuset stron.
Notion AI Q&A: RAG na Twojej bazie Notion. Gotowe rozwiązanie, działa od razu. Limit: tylko Notion, mniej kontroli nad chunkingiem i promptami.
Własny RAG: wszystko inne. Kontrola, skalowalność, integracje. Wymaga prac programistycznych.
Reguła: zacznij od Claude Projects/Notion AI. Własny RAG buduj dopiero, gdy tamte przestają wystarczać.
RODO i wrażliwe dane
RAG na danych klientów, dokumentach pracowniczych, finansach - wymaga staranności RODO. Opcje: 1) Cloud z DPA (OpenAI/Anthropic Enterprise, region EU), 2) Self-hosted z lokalnym LLM (Ollama z Llama 3.3 lub Phi-3 + lokalny embedding). Self-hosted droższy w utrzymaniu, ale daje pełną kontrolę.
Realny ROI własnego RAG
Firma B2B SaaS 80 osób, własny RAG na dokumentacji produktu + historii zgłoszeń klientów. Inwestycja: 120 000 PLN za wdrożenie + 3 000 PLN/mies. utrzymania. Po 6 miesiącach: redukcja czasu pierwszej odpowiedzi w obsłudze o 35%, wzrost samoobsługi o 22% (klienci znajdują odpowiedzi sami). Zwrot: 8 miesięcy.
Co dalej
RAG ma sens dla firm z dużą bazą dokumentów i regularnymi pytaniami. Dla mniejszych - Claude Projects lub Notion AI wystarczą. Audyt AI wskaże, czy RAG jest sensowny dla Twojej firmy, czy wystarczą gotowe narzędzia. Albo umów konsultację - opowiedz o swojej bazie wiedzy.