Cos'è HyDE nella RAG?
Tecnica pre-retrieval: un LLM genera un documento ipotetico dalla query e ne usa l'embedding per la ricerca.
HyDE (Hypothetical Document Embeddings) è una tecnica di trasformazione della query che interviene a monte del recupero, all'interno di una pipeline RAG, e riguarda solo quel passaggio iniziale, non l'intera architettura di recupero: invece di trasformare in embedding direttamente la domanda dell'utente, un LLM genera prima un documento ipotetico, un testo plausibile che risponderebbe a quella domanda così come la formulerebbe un esperto del dominio, e solo quel documento generato viene trasformato in embedding e usato per interrogare il database vettoriale al posto della query originale. La domanda dell'utente non viene mai cercata così com'è: viene usata solo per far generare un candidato di risposta plausibile, e quel candidato, non la domanda stessa, diventa il vettore effettivamente usato nella ricerca. L'idea nasce dal paper di Gao et al. del 2022, "Precise Zero-Shot Dense Retrieval without Relevance Labels", ed è oggi disponibile come modulo pronto all'uso in framework di riferimento come LangChain e LlamaIndex.
Perché funziona meglio della query diretta
Il problema che risolve è geometrico: nello spazio degli embedding, una domanda breve e formulata in modo colloquiale spesso finisce lontana dai documenti reali che contengono la risposta, perché domanda e risposta usano vocabolario, lunghezza e struttura diversi. Un documento ipotetico, anche se contiene dettagli inventati o imprecisi, assomiglia molto di più nello stile e nel contenuto ai documenti veri della base di conoscenza: due testi che "sembrano risposte" si posizionano più vicini nello spazio vettoriale rispetto a una domanda e alla sua risposta. Il documento ipotetico non deve essere corretto: deve solo risultare verosimile nella forma, perché è quella somiglianza strutturale a guidare il recupero.
Un caso enterprise concreto: un assistente interno su normative di settore riceve la domanda "quali sono gli obblighi di notifica in caso di data breach". Cercare direttamente questa frase nell'indice vettoriale può mancare l'articolo di legge pertinente, scritto in linguaggio tecnico-normativo molto diverso. Un LLM genera invece un paragrafo ipotetico in stile normativo ("il titolare del trattamento notifica l'autorità di controllo entro 72 ore dalla scoperta della violazione..."), e l'embedding di quel paragrafo recupera l'articolo reale con precisione nettamente superiore, perché entrambi i testi condividono registro e struttura.
Perché conta per chi decide
HyDE ha un costo aggiuntivo preciso: una chiamata LLM in più per ogni query, prima ancora del recupero, che aumenta latenza e spesa token rispetto all'embedding diretto della domanda. Ha senso quando le query reali sono corte, ambigue o formulate in linguaggio comune mentre i documenti target usano un registro tecnico o normativo distante, il caso in cui il recupero diretto perde più risultati. Non serve quando le domande sono già vicine per stile ai documenti (FAQ su prodotto proprio, ricerca su codice), dove la query diretta recupera bene senza il passaggio extra. È complementare, non alternativa, alla ricerca ibrida e reranking: HyDE trasforma la query prima della ricerca, il reranking riordina i risultati dopo. Nella pratica si valuta prima su un campione di query reali, misurando il guadagno di recall rispetto al costo della chiamata extra, perché su corpus dove domanda e documento sono già vicini il guadagno può essere marginale o nullo.
Domande frequenti
Termini correlati
- RAG · Tecnica che fa rispondere un LLM sui dati della tua azienda: recupera i documenti rilevanti e li passa al modello prima della risposta.
- Embedding · Rappresentazione numerica del significato di un testo o di un'immagine, usata per confrontare i contenuti per somiglianza.
- Ricerca ibrida e reranking · Lo stadio di ranking di una RAG: fonde ricerca lessicale e vettoriale, poi un reranker riordina i migliori candidati.
- Vector database · Database che indicizza i dati per significato, non per parole esatte: la memoria su cui la RAG cerca i contenuti simili a una domanda.
- Agentic RAG · RAG in cui un agente decide quando recuperare, cosa e da dove, iterando invece di eseguire un solo recupero fisso.
Un termine che ti riguarda da vicino? Parliamone.
CONTATTAMI