Podziel duże dokumenty na idealnie dopasowane, semantycznie spójne fragmenty, które zachowują znaczenie, jednocześnie mieszcząc się w limitach modelu AI. Każdy kawałek jest wzbogacony o metadane dla precyzyjnego pobierania.
Modele AI mają limity tokenów, ale twoje dokumenty nie respektują tych granic. Nasz inteligentny system dzielenia treści dzieli zawartość na optymalne rozmiary, zachowując znaczenie i kontekst, które sprawiają, że odpowiedzi są użyteczne.
Arbitralne cięcie dokumentów niszczy kontekst. Zdanie podzielone w połowie myśli dostarcza bezużytecznych odpowiedzi. Nasz algorytm dzielenia respektuje granice semantyczne:
Wynik: każdy fragment ma sens sam w sobie i dostarcza pełnych, użytecznych informacji klientom.
Różne typy treści otrzymują specjalistyczne traktowanie:
Fragmenty lekko się nakładają na granicach, zapewniając, że krytyczne informacje nie zostaną utracone na krawędziach, gdzie jeden fragment się kończy, a inny zaczyna. Ta nakładka jest zoptymalizowana, aby zrównoważyć kompletność z efektywnością przechowywania.
Każdy fragment jest wzbogacony o kompleksowe metadane:
Gdy fragment jest pobierany, klienci widzą nie tylko odpowiedź, ale SKĄD ona pochodzi: „Przewodnik instalacji > Rozdział 3 > Konfiguracja bazy danych” zamiast ogólnej cytacji.
Fragmenty są walidowane pod kątem minimalnej spójności, maksymalnych ograniczeń rozmiaru, poprawności kodowania i kompletności metadanych. Fragmenty, które nie przejdą walidacji, są oznaczane do ręcznego przeglądu, zamiast być dodawane do twojej bazy wiedzy, chroniąc jakość odpowiedzi.