Normal product
通常評価を、モデルとバージョン別に。
ANGBench Normalは、公開または社内利用のAIモデルを、出題者、対象モデル、採点者に分けて測る通常版です。 既存アプリ内の互換識別子はANGBenchNomalのまま維持し、顧客向け表示では読みやすいNormalを使います。
向いている用途
- モデル候補の比較
- モデル更新前後の回帰確認
- 8領域の不足確認
- APIエラーや未測定を0点にしない運用
Evaluation flow
Normalの流れ
Model roles
役割を分ける理由
同じモデル名でも、出題、対象、採点の役割が混ざると比較が曖昧になります。ANGBenchはroleごとにprovider、model、versionを保存します。
Questioner
通常候補はgpt-6-astra。問題と追問を作る役割です。
Target
評価対象のモデルです。ローカル、社内、BYOK HTTP endpointを区別します。
Grader
通常候補はgpt-6.1-sol。rubricと証拠にもとづいて採点します。
Honest status
Normalで未提供のもの
アカウント管理
本番アカウント認証や組織管理機能は準備中です。
Public download
Windows evaluatorの公開配布、署名、更新機構は準備中です。
Scientific validation
現段階のスコアは製品プロトタイプの評価結果であり、一般知能の証明ではありません。