講演情報
[1J4-GS-10k-01]LLM傾向性プロファイリング:マルチエージェント対話のための6軸評価フレームワーク
〇原田 悠矢1、狩野 芳伸1 (1. 静岡大学)
キーワード:
人工知能、大規模言語モデル、マルチエージェント、人狼知能
本研究では,ゼロショットでのLLM評価に対して, LLMの行動傾向を測定する6軸評価フレームワークを提案する.
6軸は対話パイプラインの入力・思考・出力段階に対応し,マルチエージェントシステムにおけるフェーズ単位のLLMモデル選択を可能にする.
GPT-5.2・Claude Opus 4.5・Gemini 3 Proの3種のLLMモデルを用いた評価により,異なるモデルの組み合わせが最適となる分散的プロファイルと,入力フェーズでのLLM間の性能の違いを確認した.
コスト・性能パレート分析の結果、思考フェーズでは予算コスト制約次第でどのLLMも選択肢としてあがった.
ゼロショットベースのLLM評価をベースラインとしたとき,提案手法がより低コストかつ高い軸別分解能を持つことが確認できた.
6軸は対話パイプラインの入力・思考・出力段階に対応し,マルチエージェントシステムにおけるフェーズ単位のLLMモデル選択を可能にする.
GPT-5.2・Claude Opus 4.5・Gemini 3 Proの3種のLLMモデルを用いた評価により,異なるモデルの組み合わせが最適となる分散的プロファイルと,入力フェーズでのLLM間の性能の違いを確認した.
コスト・性能パレート分析の結果、思考フェーズでは予算コスト制約次第でどのLLMも選択肢としてあがった.
ゼロショットベースのLLM評価をベースラインとしたとき,提案手法がより低コストかつ高い軸別分解能を持つことが確認できた.
