モデル選定
複数モデルの結果を、領域・モデル名・バージョン別に分けて比較できます。
# ANGBench AllMark
>>> evaluation = AllMark(domains=8, policy="BYOK")
>>> evaluation.measure(["coding", "debugging", "agent"])
{"measured": 3, "unmeasured": 5}
>>> evaluation.allmark
None # 未測定は0点ではなく未測定
AI evaluation, explained by domain
ANGBench AllMarkは、モデルの得意・不得意を「総合点だけ」で隠さず、コーディング、デバッグ、GUI操作、調査検証などの領域別に測る対話型ベンチマークです。 8領域すべてを測った時だけ総合AllMarkを表示し、未測定領域を0点扱いしません。
Python.orgの情報設計から着想した配色とコードパネルです。Python、PSF、python.orgとは非提携です。
複数モデルの結果を、領域・モデル名・バージョン別に分けて比較できます。
未測定を0点にせず、判断に必要な穴をそのまま見せます。
BYOKで評価先を明示し、鍵や送信先の扱いを確認してから実行します。
機密性の高い評価では、出題・対象・採点の送信先を独立に選びます。
Product line
すべての形態で、結果の由来と未測定領域を明示する設計を大切にしています。
Approved domains
各領域は独立に評価できます。下のプレビューで、測定済みと未測定が分かれて扱われることを確認できます。
BYOK first
ANGBenchはBring Your Own Keyから始めます。初期設定ではAPIキーをセッションメモリに保持し、ソース、ログ、結果エクスポート、パッケージへ保存しません。 実endpointへの送信は、URL、モデル、コスト見積もり、データ開示を確認してから行います。
Secret mode
Secret評価では、出題者、対象モデル、採点者を独立に設定します。ローカルAI、カスタムHTTP、クラウドendpointを選べますが、未設定のまま開始したり、OpenAIへ黙って送ったりしません。
匿名化だけでは保持や送信の問題は解決しません。対象識別子、出力、採点データの送信先を確認します。
大型モデルを出題側に置く場合でも、対象モデルと採点者は別々に構成できます。
no-training、abuse logs、Responses stateは別の話です。保持条件はproviderごとに確認が必要です。
Computer exams
コンピューター操作やコマンドライン評価では、再現可能な隔離環境と実結果の確認が必要です。ホスト上でモデル生成コマンドをそのまま実行しません。
Availability
準備中の機能を、利用可能なものとして見せません。評価を始める前に、必要なprovider、保持条件、実行環境を確認してください。
早期評価用のWindowsアプリがあります。公開ダウンロード配布は準備中で、初期ビルドでは.NET 8 Desktop Runtimeが必要です。
出題、対象、採点の各endpointを明示して評価する設計です。実providerの利用には、ユーザー側の鍵と送信先レビューが必要です。
クラウド版、支払い、production認証、VM自動準備は準備中です。現時点では商用クラウドサービスとして提供していません。
FAQ
いいえ。AllMarkは8領域すべてを測った時だけ表示します。未測定領域は0点ではなく、判断に必要な未測定として残します。
初期設定ではセッションメモリのみです。結果台帳やエクスポートに鍵を保存しない設計です。
ローカルまたは明示endpointを設定する前提の早期機能です。実運用前にprovider、保持条件、採点者、送信データのレビューが必要です。
現時点では製品プロトタイプです。結果は評価設計と実行条件のもとで解釈し、一般知能や絶対的優劣の証明として扱いません。