Questioner
大型モデル、ローカルAI、または社内PC上のendpointなど、問題作成側を選びます。
Secret product
ANGBench Secretは、ローカルAI、会社側PC、カスタムHTTP、クラウドendpointを明示的に選び、 出題者、対象モデル、採点者の送信先を分けて扱う評価形態です。
Independent destinations
大型モデル、ローカルAI、または社内PC上のendpointなど、問題作成側を選びます。
評価対象モデルです。weights、identity、出力の扱いを他roleと混ぜません。
採点者は出題者とは別に構成します。未確定の場合はSecret評価を開始しません。
Disclosure consent
Implemented slice
Windows evaluatorには、Secret HTTP実行経路があります。questioner、target、graderを独立endpointとして構成し、 mock serverでprovenance、redaction、cancel、error、fail-closedを検証しています。
LocalModelRuntime、CustomHttp、CloudEndpoint、OpenAIResponsesの種別を区別できます。
Secretが失敗した場合、local demo scoreへ置き換えません。indeterminateとして記録します。
本番provider、保持契約、採点者選定は未確定です。ここは導入前の決定事項です。