メインコンテンツへスキップ
宇佐美研究室
研究成果の解説

LLMの「ものさし」を検証する

AIがAIの回答を評価するとき,その評価器は何を測っているのか.LLMを測定機器として捉え,判断の偏りと品質差への感度を切り分ける「Judge Datasheet」を提案します.

三菱重工業 総合研究所との共同研究

arXiv · プレプリント · 2026

どんな課題を扱うか

生成AIの回答を別のLLMで採点する「LLM-as-a-Judge」は,モデルの比較や品質管理に使われています.しかし,同じ品質の回答でも,提示順や文章の見せ方によって判定が変わることがあります.回答を評価する前に,評価器そのものの性質を調べることが研究の出発点です.

研究の考え方

光が入らない状態でもセンサーに電流が流れる「暗電流」になぞらえ,品質差がない入力に対するLLMの判定を調べます.空の入力,同一の回答,品質を保った表現の変化,回答の提示順を制御し,品質差を段階的に変えた課題も組み合わせます.これらを評価器の特性表「Judge Datasheet」として整理します.

暗電流
品質差がないときの判定
交差感度
品質を保った表現変化への反応
位置バイアス
回答の提示順による偏り
品質差への感度
段階的な品質差の識別

研究で確かめたこと

3つの公開モデルを対象に,品質差がない条件での判定,表現や提示順への反応,品質差を識別する感度を評価しました.同点を選びやすくする指示では,偏りの指標と品質差への感度がどう変わるかを併せて検証しています.単一の正解率に集約せず,評価器の異なる性質を分けて観察する設計です.

応用を考えるときの視点

LLMによる回答の順位付けや品質検証を設計するとき,判定の偏り,品質差への感度,同点を選ぶ基準を個別に確認する視点を提供します.モデル,プロンプト,判定の読み取り方を一組の評価器として扱い,どの条件で何を測るかを明示することにつながります.

元の研究

LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

Usami, Hiroyasu, Hara, Keisuke, Tsuboi, Ayato, Matsuda, Naohiko

arXiv, 2026 · arXiv:2606.15610 [cs.CL], 22 pages, 4 figures

後続研究での参照

評価器を何として測るか.この問いは,後続の研究でも議論されています.

Stanford University

A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality

Jerry Kaplan

推論の最適化が回答品質に与える影響を測定する研究です.LLM評価器を測定機器として特性評価する先行研究として,Judge Datasheetを参照しています.

参照した論文を読む

University of Oxford

Three Ways Classical Test Theory Misleads for LLM Judges

Louis Yiven Zhu

LLM評価器に古典的テスト理論を適用する際の測定設計を検討する研究です.測定論に基づく評価器研究の一つとして,Judge Datasheetの枠組みを引用しています.

参照した論文を読む

Stony Brook University

The First Token Is Not the Verdict: Hidden Costs of Reading LLM Judges Without Generating

Gnaneswar Villuri, Hashmath Shaik, Alex Doboli

JUDGe — Can We Trust the Judge? @ NeurIPS 2026への投稿論文では,生成した文章から判定を読み取る評価器の監査例として,本研究を参照しています.最初のトークンから判定を読む方法との違いを検討しています.

参照した論文を読む

外部での紹介

· Jake Handy · AI Weekly Update

AI Research of the Week

2026年6月22日号の「AI Research of the Week」で,論文名と著者を挙げて紹介されました.

紹介記事を読む