RAG

RAG (Retrieval-Augmented Generation) to technika, w której model AI przed wygenerowaniem odpowiedzi najpierw wyszukuje istotne informacje (retrieval) w zewnętrznej bazie danych, a dopiero potem formułuje na ich podstawie tekst. System w czasie rzeczywistym dostarcza modelowi aktualny, konkretny kontekst, na podstawie którego formułuje odpowiedź. Dzięki temu odpowiedź nie opiera się wyłącznie na wiedzy „zaszytej” w modelu podczas treningu.

To właśnie mechanizm RAG stoi za działaniem systemów takich jak Google AI Overviews, ChatGPT Search, Perplexity czy asystenci AI wbudowani w wyszukiwarki. Dlatego pojęcie jest coraz częściej używane w kontekście SEO i marketingu treści.

Krok po kroku:

  1. Pytanie użytkownika – trafia do systemu w naturalnej formie, tak jak w zwykłej rozmowie z chatbotem.
  2. Wyszukiwanie (retrieval) – pytanie jest zamieniane na wektor liczbowy (embedding), który system porównuje z wektorami dokumentów w bazie wiedzy. Nie jest to proste dopasowywanie słów kluczowych, tylko podobieństwo semantyczne. System znajdzie trafny fragment, nawet jeśli użytkownik użył innych słów niż dokument źródłowy.
  3. Pobrany kontekst – z bazy wracają najbardziej pasujące fragmenty tekstu (zwykle kilka–kilkanaście kawałków dokumentów).
  4. Rozszerzony prompt – oryginalne pytanie i pobrane fragmenty są sklejane w jeden prompt, który mówi modelowi na przykład: „na podstawie poniższych fragmentów odpowiedz na to pytanie”.
  5. Model językowy (LLM) – generuje odpowiedź, ale opierając się na dostarczonym kontekście, a nie tylko na swojej wewnętrznej wiedzy.
  6. Odpowiedź – finalny tekst, często z możliwością wskazania źródeł, z których pochodzą użyte informacje.
Diagram działania RAG: pytanie, wyszukiwanie w bazie wiedzy, kontekst, model językowy, odpowiedź
Schemat przepływu RAG (Retrieval-Augmented Generation)

RAG a fine-tuning:
W przeciwieństwie do douczania modelu (fine-tuningu), RAG nie wymaga kosztownego trenowania. Bazę wiedzy można aktualizować na bieżąco, co czyni go rozwiązaniem znacznie tańszym i szybszym we wdrożeniu.

Powiązane pojęcia: baza wektorowa, chunking treści, fine-tuning, GEO

Poprzednia definicja Podobieństwo kosinusowe

Jakiego artykułu szukasz?