Normal product

通常評価を、モデルとバージョン別に。

ANGBench Normalは、公開または社内利用のAIモデルを、出題者、対象モデル、採点者に分けて測る通常版です。 既存アプリ内の互換識別子はANGBenchNomalのまま維持し、顧客向け表示では読みやすいNormalを使います。

向いている用途

  • モデル候補の比較
  • モデル更新前後の回帰確認
  • 8領域の不足確認
  • APIエラーや未測定を0点にしない運用

Evaluation flow

Normalの流れ

1BYOKキーをセッションメモリに保持
2出題者、対象、採点者endpointを設定
3領域別に問題、回答、採点を実行
4アカウント、モデル、バージョン別に結果を記録

Model roles

役割を分ける理由

同じモデル名でも、出題、対象、採点の役割が混ざると比較が曖昧になります。ANGBenchはroleごとにprovider、model、versionを保存します。

Questioner

通常候補はgpt-6-astra。問題と追問を作る役割です。

Target

評価対象のモデルです。ローカル、社内、BYOK HTTP endpointを区別します。

Grader

通常候補はgpt-6.1-sol。rubricと証拠にもとづいて採点します。

Honest status

Normalで未提供のもの

アカウント管理

本番アカウント認証や組織管理機能は準備中です。

Public download

Windows evaluatorの公開配布、署名、更新機構は準備中です。

Scientific validation

現段階のスコアは製品プロトタイプの評価結果であり、一般知能の証明ではありません。