/note/tech

高速な判断に特化したAI - TypeSafe「Jev」 と System One Model

要約:

■ 1. Jevの発表

  • TypeSafe AIの新モデル:
    • 2026年9月15日にTypeSafe AIがAIモデル「Jev」を発表
    • 現在はEarly Accessでの提供
  • 文章ではなく判断を出力:
    • ChatGPTのように文章を生成するのではなく、入力された状況から型付きの判断とその確率を高速に返すことに特化
    • 一般的なLLMは入力からトークンを1つずつ生成し、文章やJSON、コードを出力する
    • Jevは状態(State)と判断してほしいこと(Questions)を入力し、型付きの判断と確率を出力する
  • 入出力の具体例:
    • 「商品が壊れていたので返金してほしい」という問い合わせに対し、返金要求か、どの部署へ送るか、人間による確認が必要かを問う
    • 返金要求の真偽値0.97、部署はbillingで確率0.82、人間による確認の必要性0.31といった判断がJSONで返る
  • 設計思想の表現:
    • TypeSafeはこれを「非構造化された状態を入力し、型付きの確率的な判断を出力する」(unstructured state in, typed probabilistic decisions out) と表現
    • 自然言語などを含む状態を入力し、プログラムから直接利用できる型付きの確率的判断を出力する

■ 2. System One Model

  • カーネマンの二重過程理論に由来:
    • 「System One」の名はDaniel Kahnemanの『Thinking, Fast and Slow』で知られるSystem 1 / System 2の考え方に由来
    • System 1は高速で直感的な判断、System 2は時間をかけた熟考を表す
  • 短いループの反復を重視:
    • 長い推論や文章生成ではなく、状態から高速に判断し、プログラムが実行するという短いループの反復に重点を置く
  • ベンチマーク結果:
    • 公式ベンチマークの判断タスク一致率はJev 67.8%、GPT-5.6 Terra 67.9%でほぼ同水準

■ 3. 高速性の根拠

  • 応答時間は70〜500ms:
    • TypeSafe公表のエンドツーエンド応答時間は70〜500ms
    • System One型のクエリでは、同程度の知能レベルとして比較したLLMより40〜200倍高速になる場合があるとされる
  • Workflow Evalsの結果:
    • 特定のワークフローで最大193.6倍高速、444.6倍低コストという結果が報告されている
    • ただしJevが常にLLMより193.6倍高速という意味ではない
    • TypeSafe自身も、実際のユースケースでは改善幅の上限に近い結果だろうと説明している
  • parallel samplerの採用:
    • 一般的なLLMは基本的に出力トークンを順番に生成する
    • Jevは「parallel sampler」と呼ぶ仕組みにより、複数の判断を並列に出力する
    • 敵がいるか0.96、攻撃するか0.84、左へ行くか0.13、右へ行くか0.81といった判断を同時に得る
  • アーキテクチャと学習手法:
    • 高速な判断出力の実現のため、新しいモデルアーキテクチャやRLCDと呼ばれる学習手法も採用している

■ 4. DOOMのリアルタイム操作

  • 約10Hzでの判断出力:
    • TypeSafeが公開するDOOMのデモでは、Jevへの問い合わせを1秒間に約10回(10 Hz)行っている
    • 平均して約100msに1回のペースで問い合わせ、ゲーム状態から判断、ゲーム操作、新しいゲーム状態というループを繰り返す
  • コストと入力形式:
    • 毎秒10クエリで動かした場合のコストは約7ドル/時
    • JevがDOOMの画面を直接見ているわけではなく、ゲーム状態を構造化データとテキストとして渡している
  • ロボットへの応用可能性:
    • 掴むか0.91、危険か0.03、停止するか0.02、対象Aか0.88といった判断を繰り返す構成が考えられる
    • 100ms前後ではモーターを直接動かす高速なサーボ制御には向かない
    • 対象物の選択、行動の切り替え、異常検出、タスク判断など数Hz〜10Hz程度の上位レベル判断には利用できる可能性がある
  • 測定条件の注意点:
    • 70msという速度はTypeSafeのサービス拠点に近い米国西海岸などから測定した値
    • 日本からクラウドAPIを利用する場合はネットワーク遅延も加わる

■ 5. LLMとの違い

  • Structured Outputsとの差:
    • 現在のLLMにもJSON Schemaなどで出力形式を固定するStructured Outputsがあり、Jevの特徴は単に「JSONを壊さない」ことではない
    • LLMは文章やコードを生成し、必要なら出力形式を制約するモデル
    • JevはChoice、Score、Yes-Noなどの判断を確率付きでプログラムへ渡す設計
    • LLMが構造化データをトークン列として生成するのに対し、Jevは最初から型付きの判断と確率を出力することに特化している
  • 「ハルシネーションしない」の意味:
    • TypeSafeはJevについて「ハルシネーションしない」(can't hallucinate) と説明している
    • これは自由な文字列を生成せず、事前に定義された型や選択肢以外を出力しないことを指す表現
    • 一般的な意味での事実誤認がなくなることを保証するものではない
    • 型や形式が正しくても誤った選択肢を選ぶ可能性はあり、「型が正しい」ことと「判断が正しい」ことは別

■ 6. LLMとの組み合わせ

  • 置き換えではなく併用:
    • JevはLLMを置き換えるというより組み合わせる使い方が考えられる
    • Agentが高速な分類・判断をJevへ、推論や文章・コード生成をLLMへ振り分ける構成となる
  • 役割分担の例:
    • このメールは重要か、次のツールを実行するべきか、結果に問題がないかといった小さな判断はJevに任せる
    • 複雑な推論や文章生成が必要なときだけLLMを呼び出す
  • スマートなif文:
    • TypeSafeはこうした用途を「スマートなif文」(smart if-statements) と表現している
    • JevをAI版のif文として、アプリケーションのさまざまな場所に配置するイメージ

■ 7. まとめ

  • Jevの位置づけ:
    • 文章生成ではなく高速で型安全な確率的判断に特化したAIモデル
    • 70〜500msの応答時間とDOOMを約10Hzで操作するデモは、AIをゲームやアプリケーションの処理ループに組み込む可能性を示す
  • 新しいアプローチとしての注目点:
    • 現在はEarly Accessで、性能値の多くはTypeSafeによる評価である点に留意が必要
    • 「高性能なAIを1回呼ぶ」のではなく「小さなAI判断を大量かつ高速に呼ぶ」という考え方が示された
    • AIエージェントやゲーム、ロボットにおけるリアルタイムAIの新しいアプローチとして注目される