講演情報
[4K1-GS-6a-06]LLMによるWeb記事ライティングにおけるアラインメント手法の比較
〇山本 彩弥加1、木村 賢2、越仲 孝文1 (1. 横浜市立大学、2. 株式会社サイバーエージェント)
キーワード:
大規模言語モデル、アラインメント、検索エンジン最適化、LLM-as-a-Judge、ウェブライティング
近年,Web記事ライティングにおいてもLLMの活用が活発に議論されている.Web記事ライティングの目的は多くのページビューを得ることであり, 検索エンジン最適化(SEO)の観点ではユーザの好み(選好性)に合致したコンテンツを作ることに帰着する.
本研究では,ユーザの選好性をLLMに反映させるアラインメント手法としてDirect Preference Optimization(DPO)およびKahneman-Tversky Optimization(KTO)に着目し,可読性や文量,情報の正確性が求められるWeb記事ライティングというドメインでの両手法の効果を比較する.
SEOでよく行われるユーザ評価テストのスキームにならった人手評価により,各モデルにより生成されたWeb記事を複数の観点で評価し,KTOによりアライメントされたモデルがより高いスコアを獲得できることを確認し,同手法の優位性を示す.さらに,人間のレータの代わりにLLMを用いて同様のテストを実施し,LLM-as-a-Judgeの妥当性を検証する.
本研究では,ユーザの選好性をLLMに反映させるアラインメント手法としてDirect Preference Optimization(DPO)およびKahneman-Tversky Optimization(KTO)に着目し,可読性や文量,情報の正確性が求められるWeb記事ライティングというドメインでの両手法の効果を比較する.
SEOでよく行われるユーザ評価テストのスキームにならった人手評価により,各モデルにより生成されたWeb記事を複数の観点で評価し,KTOによりアライメントされたモデルがより高いスコアを獲得できることを確認し,同手法の優位性を示す.さらに,人間のレータの代わりにLLMを用いて同様のテストを実施し,LLM-as-a-Judgeの妥当性を検証する.
