Anthropic / Claude / Claude Code のロゴ

Anthropic / Claude / Claude Code / 公式ブログ / 2026/07/13 / 通常

HebbiaがClaude Fable 5で金融文書調査の精度を検証

AIfinanceagents

公式ブログ原文

金融調査基盤を提供するHebbiaは、Claude Fable 5を金融文書の質問・引用評価と複数資料をまたぐエージェント評価で試験しました。公式ブログでは、精度向上だけでなく、根拠を追える小さな工程へ案件調査を分解する運用が中心に語られています。

要点

  • Hebbiaは上位50社の資産運用会社の3分の1超、主要投資銀行や法律事務所へMatrixを提供しています。
  • 金融文書の質問回答・引用テストで、Claude Fable 5は従来モデルに対して約20%の相対精度向上を記録したとしています。
  • 引用一致率はほぼ同水準で、改善は見つけた証拠を正しく理解し、複数条件をまとめて処理する能力から来たとHebbiaは解釈しています。
  • 何千件もの非構造文書、信用契約、修正文書、サイドレターをまたぐ調査と、投資メモやレビュー初稿の作成へ対象を広げています。
  • 数分での成果はHebbiaのMatrix、独自評価、ツール、分解済み工程を含む事例であり、Fable 5単体の一般的な処理時間ではありません。

今回のブログ記事で語られていること

Hebbiaは、投資判断に必要な公開資料、信用契約、社内文書、CRMなどの構造化データを、Matrixという格子状の作業面で調べます。利用者の自然言語の依頼を複数の手順へ分解し、Claudeが数百の文書へ順番に処理をかけ、各回答と引用をセルごとに表示します。金融では一つの数字や条項の読み違いが案件判断を変えるため、回答の見栄えより、どの資料のどの記述から結論を得たかを追えることを重視しています。

新モデルの採用は公開ベンチマークだけで決めません。Hebbiaの応用AIチームは、金融専門職の実作業を再現する独自評価で、置き換え対象のモデルと直接比較します。一つは金融文書を使う質問回答と引用箇所の特定、もう一つは実際のチャット製品が使うツールを含めた、複数資料をまたぐ自由度の高いエージェント課題です。モデル能力が上がるたびに、評価側も難しくしていると説明しています。

Claude Fable 5は両方の評価でHebbiaがこれまで測った最大の差を出しました。質問回答・引用テストでは、金融文書に対する精度が約20%相対的に向上しました。一方、引用一致率はほぼ変わらず、Hebbiaは証拠を探す能力が突然伸びたというより、見つけた情報を理解し、正しく統合する能力が改善したと見ています。エージェント課題では、複数の依頼条件を途中で落とさず、それぞれの回答を資料へ結び付けました。

実務例として、数千文書を含むデータルームから重要情報を探し、投資メモの各節を作る作業や、信用契約、修正文書、サイドレターから財務条件、制約、コベナンツを抽出する作業が挙げられています。従来のSonnetやOpusでも条項の抽出・要約はできましたが、Fable 5では、その後の多段階分析、監視データとの比較、リスクの抽出、社内レビュー初稿までを一続きの工程へ広げようとしています。

記事は時間短縮も強調します。以前は若手銀行員が企業を調べ、財務を集め、経営者向け提案資料を作るのに2〜3日かかり、初期のAI導入で12〜24時間短縮され、過去のOpusでは一日程度になったとHebbia担当者は説明しています。現在のMatrixは、データ収集、分析、資料・財務モデル・社内調査の生成を決定的な工程へ分け、数分で初稿を作るとしています。これは顧客条件や課題による事例値で、第三者が独立検証した平均時間ではありません。

興味深いのは、モデルが高性能になっても工程分解をやめていない点です。金融機関は、どの文書を入力し、各段階で何を行い、どこを人が確認するかを制御したいからです。HebbiaはClaudeエージェントSDKを使い、長い一回のモデル実行ではなく、小さく反復可能で確認できる段階へ組み立てています。モデル能力の向上を、監査可能性を捨てる理由ではなく、より長い仕事を同じ統制下へ載せる材料として扱っています。

背景にあるテーマ

金融の生成AI活用では、正解率だけでなく、引用の対応、複数条件の保持、文書間の矛盾、途中工程の再現性が重要です。非構造文書を読む範囲が広がるほど、人の最終判断を支える証跡と、モデルが推測した箇所を区別する設計が必要になります。

今回のブログ記事が関係する人

投資銀行、資産運用、プライベートエクイティ、信用調査、法律実務で大量文書を扱うチーム、金融向けAI製品の評価担当、引用・監査証跡を設計するリスク管理担当に関係します。

どう読むと価値があるか

約20%という相対精度と、数分で初稿という時間値を分けて読みます。前者はHebbiaの独自評価、後者はMatrix全体の工程を含む事例です。評価問題数、絶対精度、誤りの種類は公開されていないため、自社文書で再現する必要があります。

実務へのつながり

過去に人が完了した案件から、契約条項抽出、複数資料の整合確認、引用付きメモ作成を選びます。正答率に加え、引用が主張を本当に支えるか、依頼条件を落としていないか、数値と日付を取り違えていないかを専門家が評価します。工程ごとに入力資料、出力、再実行条件、人の承認点を残します。

結局、今回のブログ記事をどう読むべきか

Fable 5の性能紹介であると同時に、高性能モデルを金融調査へ入れる際も工程分解と引用追跡を維持する事例です。モデルの自律時間を伸ばすことより、根拠を失わずに扱える仕事の範囲を広げることが本当の読みどころです。