Calculateur de découpage RAG
Données
| Jetons du document | 8 000 |
|---|---|
| Taille de segment | 512 |
| Chevauchement | 64 |
Calculateur de découpage RAG
Déterminez en combien de segments chevauchants un document est découpé pour la génération augmentée par récupération, et combien de jetons cela transmet au modèle d'embeddings.
Données
Document
Découpage
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Le découpage en RAG
La génération augmentée par récupération (RAG, pour retrieval-augmented generation) répond à une question en cherchant d'abord, dans une collection de documents, les passages pertinents, puis en transmettant ces passages à un modèle de langage. Comme un document entier est généralement trop long pour être embarqué et récupéré comme une seule unité, chaque document est d'abord divisé en morceaux plus petits appelés segments. Le découpage est l'étape qui décide de la façon dont ces morceaux sont taillés, et il conditionne à la fois la qualité de récupération et le coût d'embedding. Ce calculateur indique combien de segments produit un document d'une longueur donnée et combien de jetons cela transmet au modèle d'embeddings.
Comment fonctionne le découpage
Un découpeur fait glisser une fenêtre de taille fixe sur le document. La fenêtre
est large de chunk_size jetons, et après avoir émis chaque segment elle avance
d'un pas plutôt que de sa largeur entière, de sorte que deux segments
consécutifs partagent une bande de chunk_overlap jetons. Le chevauchement
existe pour qu'un fait à cheval sur une frontière de segment reste entier dans
au moins un segment — sans lui, une phrase coupée en deux pourrait n'être
récupérable depuis aucune des deux moitiés.
Le pas est la taille de segment moins le chevauchement :
s=c−oUn document de jetons est couvert une fois que le premier segment a consommé jetons d'avance et que les jetons restants ont été parcourus par pas de , ce qui demande
n=⌈sT−o⌉segments. Le plafond tient compte de la dernière fenêtre, éventuellement courte. Chacun des segments est embarqué à sa pleine taille, si bien que le total des jetons transmis au modèle d'embeddings vaut
Temb=n⋅cParce que chaque segment après le premier répète jetons, est plus grand que le d'origine dès que le chevauchement est non nul.
Exemple chiffré
Prenons un document de 8 000 jetons, découpé avec une taille de segment de 512 et un chevauchement de 64. La fenêtre avance de
s=512−64=448 jetonset le nombre de segments est
n=⌈4488000−64⌉=⌈4487936⌉=⌈17.71⌉=18Embarquer les 18 segments à pleine taille transmet
Temb=18×512=9216 jetonsau modèle d'embeddings. Le chevauchement a gonflé le volume embarqué de 8 000 à 9 216 jetons — environ 15 % de plus — ce qui est le prix à payer pour garder intacts les passages à cheval sur une frontière. Ce rapport est proche de la taille de segment divisée par le pas, .
Notes et variantes
Les découpeurs réels coupent rarement sur des frontières de jetons exactes. La plupart respectent les ruptures de phrases ou de paragraphes, de sorte que les segments varient en longueur et que le compte diffère légèrement de l'estimation à fenêtre uniforme donnée ici. Les découpeurs récursifs et sémantiques ajustent les frontières à la structure naturelle, échangeant l'uniformité contre la cohérence. La fraction de chevauchement est le principal levier sur le volume embarqué : un chevauchement de 50 % double à peu près les jetons embarqués, tandis qu'un chevauchement nul embarque exactement la longueur du document mais risque de scinder des faits.
Application
Le nombre de segments détermine le dimensionnement en aval. Chaque segment devient un vecteur, ce qui alimente directement l'empreinte de l'index calculée par Calculateur de taille de base de données vectorielle, et le total de jetons embarqués fixe la dépense d'embedding ponctuelle estimée par Calculateur de coût d'embeddings. Régler la taille de segment et le chevauchement revient donc à arbitrer la précision de récupération contre le stockage et le coût d'embedding à la fois.
Questions fréquentes (FAQ)
Pourquoi ajouter un chevauchement entre les segments ?
Une coupure nette peut scinder une phrase, une ligne de tableau ou un fait, ne laissant à aucun segment l'information complète. Le chevauchement répète la fin d'un segment au début du suivant, de sorte qu'un passage à cheval sur une frontière reste intact dans au moins un segment. La contrepartie est que les jetons répétés sont embarqués plus d'une fois, ce qui augmente le coût d'embedding et ajoute à l'index des entrées quasi identiques.
Quelle taille de segment choisir ?
Il n'existe pas de valeur universellement optimale ; elle dépend du contenu et de la tâche de récupération. Des segments plus petits, de 256 à 512 jetons, isolent une seule idée par segment et récupèrent avec précision, ce qui convient à la recherche de faits. Des segments plus grands, de 1 000 jetons ou plus, conservent davantage de contexte environnant, ce qui aide la synthèse et les questions de raisonnement.
Un point de départ courant est 512 jetons avec un chevauchement de 10 à 20 %, puis un ajustement selon la qualité de récupération.
Pourquoi embarque-t-on plus de jetons que le document n'en contient ?
Chaque segment après le premier répète la zone de chevauchement du segment précédent, si bien que ces jetons sont embarqués deux fois. Le total embarqué est le nombre de segments multiplié par la taille de segment, ce qui dépasse la longueur brute du document dès qu'il existe un chevauchement.
Le rapport entre jetons embarqués et jetons du document est à peu près la taille de segment divisée par le pas, de sorte qu'un fort chevauchement peut gonfler le volume d'embedding bien au-delà de la taille du document d'origine.
Mentions légales
Le décompte des jetons dépend du tokeniseur du modèle et de la façon dont le découpeur gère les frontières de phrases et de paragraphes ; les pipelines réels produisent rarement des segments parfaitement uniformes. Considérez ces chiffres comme des estimations de planification et vérifiez les décomptes exacts et la dépense d'embedding avec vos propres outils.
Recommandations
Calculateur de coût d'embeddings
Estimez le coût ponctuel de la vectorisation d'un corpus de documents pour la recherche, à partir du nombre de documents, du nombre de jetons par document et du prix par million de jetons du modèle d'embeddings.
Calculateur de taille de base de données vectorielle
Estimez l'empreinte de stockage d'un index d'embeddings à partir du nombre de vecteurs, de la dimension des vecteurs, du nombre d'octets par valeur et du surcoût d'index ajouté par les structures de recherche du plus proche voisin approché.