Pecah dokumen besar menjadi potongan yang ukurannya sempurna, koheren secara semantik yang mempertahankan makna sambil memenuhi batas model AI. Setiap potongan diperkaya dengan metadata untuk pengambilan presisi.
Model AI memiliki batas token, tetapi dokumen Anda tidak menghormati batasan tersebut. Sistem pembagian cerdas kami memecah konten menjadi ukuran optimal sambil mempertahankan makna dan konteks yang membuat jawaban berguna.
Memotong dokumen secara sembarangan menghancurkan konteks. Sebuah kalimat yang dipisahkan di tengah pikiran memberikan jawaban yang tidak berguna. Algoritma pembagian kami menghormati batasan semantik:
Hasilnya: setiap potongan masuk akal dengan sendirinya dan memberikan informasi lengkap yang berguna kepada pelanggan.
Jenis konten yang berbeda mendapatkan penanganan khusus:
Potongan tumpang tindih sedikit di batas, memastikan informasi penting tidak hilang di tepi di mana satu potongan berakhir dan yang lain dimulai. Tumpang tindih ini dioptimalkan untuk menyeimbangkan kelengkapan dengan efisiensi penyimpanan.
Setiap potongan diperkaya dengan metadata yang komprehensif:
Ketika sebuah potongan diambil, pelanggan tidak hanya melihat jawaban tetapi DI MANA itu berasal: "Panduan Instalasi > Bab 3 > Pengaturan Database" alih-alih kutipan umum.
Potongan divalidasi untuk koherensi minimum, batas ukuran maksimum, kebenaran encoding, dan kelengkapan metadata. Potongan yang gagal validasi ditandai untuk tinjauan manual daripada ditambahkan ke basis pengetahuan Anda, melindungi kualitas jawaban.