allmark.preview
# ANGBench AllMark
>>> evaluation = AllMark(domains=8, policy="BYOK")
>>> evaluation.measure(["coding", "debugging", "agent"])
{"measured": 3, "unmeasured": 5}
>>> evaluation.allmark
None  # 未測定は0点ではなく未測定

AI evaluation, explained by domain

AIの実力を、説明できる8領域の結果に。

ANGBench AllMarkは、モデルの得意・不得意を「総合点だけ」で隠さず、コーディング、デバッグ、GUI操作、調査検証などの領域別に測る対話型ベンチマークです。 8領域すべてを測った時だけ総合AllMarkを表示し、未測定領域を0点扱いしません。

Python.orgの情報設計から着想した配色とコードパネルです。Python、PSF、python.orgとは非提携です。

Product line

用途に合わせた3つの形態

すべての形態で、結果の由来と未測定領域を明示する設計を大切にしています。

ANGBench Normal

通常評価向け。BYOKで出題・対象・採点endpointを設定し、モデルとバージョンを分けて記録します。

Normalを見る

ANGBench-Secret

機密評価向け。出題者、対象モデル、採点者を独立構成し、明示的な開示確認なしでは送信しません。

Secretを見る

Paid ANGBench cloud

低スペック端末向けのクラウド版は準備中です。現時点で認証、課金、クラウド推論の商用運用は開始していません。

Cloudを見る

Approved domains

AllMarkを構成する8領域

各領域は独立に評価できます。下のプレビューで、測定済みと未測定が分かれて扱われることを確認できます。

Result preview 3/8 measured

    BYOK first

    鍵はユーザーが持ち、評価先を明示する

    ANGBenchはBring Your Own Keyから始めます。初期設定ではAPIキーをセッションメモリに保持し、ソース、ログ、結果エクスポート、パッケージへ保存しません。 実endpointへの送信は、URL、モデル、コスト見積もり、データ開示を確認してから行います。

    Secret mode

    Secret評価は送信先レビューを前提にする

    Secret評価では、出題者、対象モデル、採点者を独立に設定します。ローカルAI、カスタムHTTP、クラウドendpointを選べますが、未設定のまま開始したり、OpenAIへ黙って送ったりしません。

    プライバシーと匿名性を分ける

    匿名化だけでは保持や送信の問題は解決しません。対象識別子、出力、採点データの送信先を確認します。

    送信先を独立に選ぶ

    大型モデルを出題側に置く場合でも、対象モデルと採点者は別々に構成できます。

    保持ゼロとは言わない

    no-training、abuse logs、Responses stateは別の話です。保持条件はproviderごとに確認が必要です。

    Computer exams

    GUI/PC操作は隔離環境で検証する

    コンピューター操作やコマンドライン評価では、再現可能な隔離環境と実結果の確認が必要です。ホスト上でモデル生成コマンドをそのまま実行しません。

    Availability

    現在の提供状況

    準備中の機能を、利用可能なものとして見せません。評価を始める前に、必要なprovider、保持条件、実行環境を確認してください。

    Windows evaluator

    早期評価用のWindowsアプリがあります。公開ダウンロード配布は準備中で、初期ビルドでは.NET 8 Desktop Runtimeが必要です。

    BYOK HTTP evaluation

    出題、対象、採点の各endpointを明示して評価する設計です。実providerの利用には、ユーザー側の鍵と送信先レビューが必要です。

    Cloud and managed plans

    クラウド版、支払い、production認証、VM自動準備は準備中です。現時点では商用クラウドサービスとして提供していません。

    FAQ

    導入前に確認すること

    総合点だけを見れば十分ですか?

    いいえ。AllMarkは8領域すべてを測った時だけ表示します。未測定領域は0点ではなく、判断に必要な未測定として残します。

    APIキーはどこに保存されますか?

    初期設定ではセッションメモリのみです。結果台帳やエクスポートに鍵を保存しない設計です。

    Secret評価はすぐ使えますか?

    ローカルまたは明示endpointを設定する前提の早期機能です。実運用前にprovider、保持条件、採点者、送信データのレビューが必要です。

    科学的に標準化されたベンチマークですか?

    現時点では製品プロトタイプです。結果は評価設計と実行条件のもとで解釈し、一般知能や絶対的優劣の証明として扱いません。