結論​(即答)​: Sakana Fugu とは​・​使った​結論

Fugu Ultra は、​11〜21分待てる​重い​判断にだけ呼ぶ​「二人目の​意見役」と​して​使うのが​合っています。

Sakana Fugu は、​Sakana AI が​2026年6月22日に​公開した​モデルです。​複数の​AIモデルを​1つの​APIの​裏側で​使い分け、​検証と​統合までを​ Fugu 側が​受け持ちます。​呼び出す側からは、​1つの​モデルに​質問しているように​見えます。

当社は​2026年6月に​初回評価を​し、​7月から​試験的に​呼び出し、​9月に​社内の​判断手順へ​組み込みました。

当社に​残る​呼び出しログは​7本です​(完走5本・​失敗1本・​疎通確認1本)。​完走5本から​分かった​ことは​3つです。

  • 1回の​回答に​11〜21分かかりました
  • 費用は​1回あたり約0.4〜0.9ドルでした​(公式単価からの​推定)
  • 回答は​長く、​結論・根拠・リスクまで​構造立てて​返ってきます

速さを​求める​場面には​向きません。​後戻りしにくい判断で、​別の​視点を​1つ足したいときに​役立ちます。

仕組み: 指揮役の​モデルが、​ほかの​AIに​仕事を​振り分ける

Fugu の​中身は、​質問ごとに​「どの​AIに、​どう​解かせるか」を​決める​指揮役の​モデルです。

公式ページの​「Tech Behind」に​よると、​土台は​2026年の​国際学会 ICLR に​採択された​2本の​論文です。

  • TRINITY: 軽量な​指揮役が、​複数の​AIを​数ターンに​わたって​動かします。​各AIに​ Thinker​(考える​役)、​Worker​(作業する​役)、​Verifier​(検証する​役)を​割り​当てます
  • Conductor: 強化学習で​訓練した​指揮役が、​AI同士の​連携のさせ方を​自然文で​組み立てます

技術報告​(arXiv 2606.21228、​2026年6月)には、もう​少し​細かい​説明が​あります。​Fugu は​ TRINITY と​違い、​選んだ​モデルに​毎回 Worker と​して​仕事を​渡すと​書かれています。

また​ Conductor の​枠組みでは、​指揮役自身を​作業役と​して​呼べます。​指揮役自身を​入れ子で​呼ぶことで、​より​複雑な​連携の​形を​作れると​いう​説明です。

同じ​報告は、​6月時点の​作業役と​して​3つの​モデルを​挙げています。​Gemini 3.1 Pro、​Claude Opus 4.8、​GPT-5.5 です。​ただ、​現行版で​どの​モデルを​どう​組み合わせているかは​非公開です。

指揮役の​モデルの​大きさ(パラメータ数)は、​公式ページと​技術報告の​概要からは​確認できませんでした。

モデルの​種類と​料金

用途に​応じて​3系統​あり、​当社が​使っているのは​品質優先の​ Fugu Ultra です。

公式ページ​(sakana.ai/fugu/)の​記載を​表に​まとめました。

モデル 従量課金​(100万トークンあたり) 公式が​示す用途
Fugu 裏で​使った​モデルの​標準単価 日常作業。​速さと​品質の​バランス向け
Fugu Max 入力2ドル/出力6ドル/キャッシュ入力0.25ドル 費用を​抑えたい用途。​Web検索1回0.007ドル
Fugu Ultra​(現行は​ v2.0。​発表名は​ Fugu Ultra v2) 入力5ドル/出力30ドル/キャッシュ入力0.5ドル 難しい​多段階の​問題。​応答時間より​品質を​優先

Fugu Ultra は、​文脈が​27.2万トークンを​超えると​単価が​上がります。​入力10ドル、​出力45ドル、​キャッシュ入力1ドルです。​Fugu Max は​文脈の​長さで​単価が​変わりません。

この​ほかに、​セキュリティ分析向けの​ Fugu Cyber が​あります。​料金は​営業窓口への​問い​合わせです。

公式 FAQ には、​課金に​ついて​2つの​説明が​あります。

  • 複数の​エージェントが​動いても​料金は​重ならず、​関わった​最上位モデルの​単価1本で​請求される
  • トークン使用量と​費用は​リクエストごとに​報告され、​支出を​その場で​追える

月額プラン

従量課金とは​別に、​月額の​定額プランが​3つあります。

プラン 月額 利用枠 公式の​想定
Standard 20ドル 基準量​(1倍) 軽い​日常利用
Pro 100ドル Standard の​10倍 集中して​作業する​時間帯
Max 200ドル Standard の​20倍 重く​長時間の​作業

どの​プランでも、​Fugu・Fugu Ultra・Fugu Max の​3つを​使えます。

当社で​使っているのは​従量課金で、​月額プランは​試していません。

「Max プラン」と​「Fugu Max」は​別物

名前が​似ていますが、​Max プランは​月額200ドルの​料金プランです。​Fugu Max は、​費用を​抑えた​モデルの​名前です。

Max プランに​入ると、​Fugu Max だけでなく​ Fugu Ultra も​使えます。​逆に​ Fugu Max は、​Standard プランでも​従量課金でも​使えます。

無料で​試す方法​(Sakana Chat)

API を​使わずに​試すなら、​ブラウザで​使える​ Sakana Chat​(chat.sakana.ai)が​あります。

報道に​よると、​Sakana Chat の​モデル選択で​ Sakana Fugu や​ Fugu Max を​選べます。​当社では​確認していません。

「無料で​使える」​「Fugu の​利用には​メール登録が​要る」と​いう​条件は、​報道記事に​載っています。​公式の​告知ページでは、​無料か​どうかと​回数の​上限は​確認できませんでした。

ベンチマーク​(公式値)

公式の​数値では、​Fugu Ultra は​主要な​試験で​当時の​大手モデルと​同等以上の​点を​出しています。

技術報告​(2026年6月、​初版)の​表から、​主要な​指標を​抜き出しました。

指標 Fugu Ultra Fugu Claude Opus 4.8 Gemini 3.1 Pro GPT-5.5
SWE-Bench Pro​(コード修正) 73.7 59.0 69.2 54.2 58.6
GPQA-Diamond​(専門知識の​推論) 95.5 95.5 92.0 94.3 93.6
LiveCodeBench Pro​(競技プログラミング) 90.8 87.8 84.8 82.9 88.4
Humanity's Last Exam​(難問総合) 50.0 47.2 49.8 44.4 41.4
Terminal Bench 2.1​(端末操作) 82.1 80.2 74.6 70.3 78.2

比較相手の​点の​一部は、​各社が​公表した​値の​引用です。

その後の​更新でも​数値が​出ています。

  • 7月24日の​ v1.1 では、​v1.0 から​最大7.9ポイント伸びたと​公式が​発表しました
  • 9月11日の​ Fugu Ultra v2.0 では、​図表読解の​ Chartography で​48.3と​発表されました。​比較と​して​示された​ Opus 5 は​27.3、​Fable 5 は​29.5です
  • 同じ​発表では、​指揮対象から​ Fable 5、​Fable 5.1、​GPT-6 Astra を​外しています。​この​数値は、​それらを​含めずに​出したものです

当社の​実測: 所要時間と​費用

完走した​5本は、​どれも​11分以上​かかりました。

当社の​呼び出しログ7本を​そのまま​載せます。​所要時間は、​ログの​作成時刻と​更新時刻の​差です。​費用は、​公式単価に​応答の​トークン数​(prompt_tokens/completion_tokens)を​掛けた​推定値です。

日付 所要時間 入力/出力トークン 推定費用 用途
9/13 0秒 — — 失敗​(質問文が​空で​エラー)
9/13 9秒 761/197 約0.01ドル 短い​問いでの​疎通確認
9/13 693秒 7,222/13,903 約0.45ドル 自社ゲームの​試遊レビュー
9/13 663秒 8,104/14,338 約0.47ドル 自社ゲームの​試遊レビュー
9/21 1,279秒 2,125/28,242 約0.86ドル 自社サイトの​方針審査
9/22 820秒 2,953/13,991 約0.43ドル 掲載カテゴリ拡大案の​検討
9/23 779秒 2,989/12,286 約0.38ドル 事業の​ゴール定義

費用の​大半は​出力です。​回答は​1万2千〜2万8千トークンで、​日本語に​すると​数万字の​報告書に​なります。

短い​問いなら​9秒で​返りました。​所要時間と​費用は、​問いの​中身で​大きく​変わります。

1本目の​失敗は​当社側の​不備です。​空の​質問文を​送ってしまい、​API が​エラーを​返しました。​この​応答には​トークン使用量の​記録が​ありません。

社内手順書の​見積もりは​「1回0.2ドル強・5〜10分」でした。​実測では、​時間は​約2倍、​費用は​最大で​約4倍かかっています。

これから​使う方は、​1回15分前後・0.4〜0.9ドルを​目安に​してください。

向く​仕事・​向かない​仕事

待ち時間と​費用に​見合うのは、​判断を​誤ったときの​損が​大きい​仕事です。

当社では、​次の​表のように​使い分けています。

使う​場面 使わない​場面
経営判断、​高額な​選択、​後戻りしにくい決定 単純な​事実確認や​用語の​質問
事業方針や​設計の​レビュー 数分で​往復したい​壁打ち
複数AIの​議論の​裁定役 台本・​コピーなどの​制作物
比較評価の​決勝で​出す案の​一つ 定型作業の​繰り返し

実例を​1つ挙げます。​7月に、​3つの​AIに​業務改善の​方針を​2ラウンド議論させました。​争点の​裁定を​ Fugu Ultra に​任せると、​筋の​通った​実行計画が​返ってきます。

ただ、​その​裁定を​別の​AIに​批判させると、​欠点も​見えました。​「方向は​妥当。​ただ、​一人会社で​回すには​管理対象が​多すぎる」と​いう​指摘です。

Fugu の​答えは、​そのまま​採用していません。​他の​AIの​批判に​かけてから​使う​前提で​置いています。

制作物では​使っていません。​台本や​コピーは、​別の​競作手順で​作っています。

始め方

OpenAI 互換の​ API なので、​既存の​コードの​接続先と​モデル名を​変えれば​動きます。

4ステップ

  1. キーを​発行する​: console.sakana.ai で​アカウントを​作り、​API キーを​発行します
  2. 接続先を​差し替える​: OpenAI の​ SDK などで、​base URL を​ https://api.sakana.ai/v1 にします
  3. モデル名を​指定する​: 当社で​使っているのは​ fugu-ultra です。​ほかに​ fugu、fugu-max、fugu-ultra-v2.0​ が​あります
  4. 待ち時間の​上限を​長く​する​: 同期 API なので、​回答が​出るまで​接続を​開けたまま​待ちます。​当社は​上限を​1,800秒​(30分)に​しています

Python の​ OpenAI SDK で​書くと、​次のようになります。

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.sakana.ai/v1",
    api_key=os.environ["SAKANA_API_KEY"],
    timeout=1800,  # 30分。短いと重い問いで打ち切られる
)
res = client.chat.completions.create(
    model="fugu-ultra",
    reasoning_effort="high",
    messages=[{"role": "user", "content": "判断したい問いをここに書く"}],
)
print(res.choices[0].message.content)
print(res.usage)  # 入出力トークンと、指揮用トークンの別枠

当社では、​これを​シェルスクリプトに​まとめて​呼んでいます。

fugu_ask.sh "問い" --effort high --timeout 1800

推論の​深さは​ reasoning_effort で​指定します。​判断系は​ high、​難所だけ xhigh に​上げます。

待っている​間に、​ほかの​AIへの​質問を​並行で​進めます。​1回の​判断で​ Fugu を​呼ぶのは​1回までと​決めています。

Claude Code から​使う

2026年7月24日の​ v1.1 の​告知で、​Claude Code から​ Fugu を​使える​接続口が​発表されました。​いつもの​ Claude Code の​作業の​中で、​Fugu に​仕事を​任せられると​いう​説明です。

設定の​手順は、​告知ページには​載っていません。​console.sakana.ai の​「get-started」を​案内しています。

Claude Code からの​利用は、​当社では​試していません。​設定の​手間や​使い​勝手は​確認していません。

OpenRouter など​ほかの​経路

AI モデルの​取次サービス OpenRouter でも、​Fugu を​選べます。​モデル名は​次の​3つです。

  • sakana/fugu-ultra
  • sakana/fugu-ultra-v2
  • sakana/fugu-max

単価は​公式と​同じ​表示でした​(2026年9月26日時点)。

当社の​導入経緯

  • 6月22日: 公開日に​評価メモを​作り、​二人目の​意見役と​いう​位置づけに​決めました
  • 7月17日: 初回の​呼び出しが​タイムアウトしました。​待ち時間の​上限が​短すぎた​ためです
  • 7月後半: 議論の​裁定役や​要件レビューで​試しました
  • 9月13日: 呼び出し用スクリプトを​整え、​疎通を​確かめました
  • 現在は、​重い​判断で​複数AIに​意見を​出させる​手順の​標準メンバーです

注意点と​未確認の​こと

中身が​見えない​こと、​請求の​内訳が​読み切れない​ことは、​当社でも​未解決です。

中で​動く​モデルは​非公開です。​ 6月の​技術報告には​作業役の​モデル名が​ありました。​一方で、​現行版の​組み合わせは​公開されていません。

その​ため、​答えが​良かった​理由も​悪かった​理由も​追い​かけられません。

指揮用トークンの​扱いは、​読み切れていません。​ 公式 FAQ は​「料金は​最上位モデルの​単価1本」​「費用は​リクエストごとに​報告」と​説明しています。

当社の​ログでは、​応答の​ usage に​入出力トークンが​記録されていました。​その​内訳の​欄に、​指揮用の​トークンが​別枠で​載っています。

指揮用トークンの​別枠は、​完走5本で​入力3.4万〜5万、​出力2.8万〜3.8万でした。​応答の​中に、​費用の​金額​そのものは​入っていませんでした。

当社の​推定費用は、​入出力トークンだけに​単価を​掛けたものです。​仮に​指揮用トークンも​同じ​単価で​請求されると、​1本あたり約1.5〜2.3ドルに​なります。

どちらが​正しいかは、​管理画面の​請求額と​比べないと​分かりません。​この​確認は​まだできていません。

ベンチマークは​再現していません。​ 上の​数字は​公式の​発表です。​比較相手の​一部は​各社の​公表値の​引用です。

一部の​非公開モデルは​含まれていません。​ 公式に​よると、​Anthropic の​ Fable 5 などは​指揮対象外です。​比較するときは、​この​点を​踏まえてください。

EU・EEA では​使えません。​ 公式 FAQ に​よると、​GDPR​(EU の​個人データ保護規則)への​対応作業中の​ためです。

入出力の​学習利用は​断れます。​ 公式 FAQ では、​管理画面の​設定から​いつでも​オプトアウトできると​書かれています。

特定の​モデルを​外せるのは​ Fugu だけです。​ 公式 FAQ では、​Fugu は​特定の​モデルや​提供元を​候補から​外せます。​Fugu Ultra と​ Fugu Max は​候補が​固定です。

文脈長は​出所で​表記が​違います。​ 公式ページは、​Fugu Ultra の​単価が​変わる​境目として​27.2万トークンを​示しています。​文脈長の​上限そのものは、​公式ページでは​確認できませんでした。

OpenRouter の​一覧では、​Fugu Ultra の​文脈長は​100万トークンです。​出力の​上限は​12.8万トークンと​表示されています​(2026年9月26日時点)。

出所が​個人・第三者の​主張も​出回っています。

  • 「別モデルが​拾えなかった​バグ27件を​1時間で​見つけた」は、​公開初日の​個人の​報告です
  • 「デザインは​他モデルに​大きく​劣る」も、​同じ方の​個人の​報告です

当社では​どちらも​検証していません。​完走5本の​試用だけで、​他モデルとの​同一条件での​比較も​未実施です。

日本語に​ついて、​公式は​一般的な​性能を​うたっていません。​当社の​7本は​すべて​日本語でやり​取りし、​回答の​日本語に​困る​場面は​ありませんでした。

Claude / GPT との​関係​(置き換えではなく​足すもの)

当社では、​Claude や​ GPT の​代わりに​使わず、​隣に​一人足す形で​使っています。

Sakana AI は、​東京を​拠点と​する​ AI 企業です。​「Building Frontier AI in Japan」を​掲げています。​Fugu の​ほかに、​日本語向けモデルの​ Namazu なども​出しています。

日常の​実装や​調べ物の​主力は、​Claude と​ GPT です。​数秒から​数分で​返るので、​往復の​多い​作業に​向きます。

Fugu Ultra は​1回15分前後かかります。​この​速さでは、​日々の​作業の​主力には​なりません。

役に​立つのは、​複数の​AIに​同じ​問いを​投げて​比べる​場面です。​当社の​手順では​ GPT、​Grok、​DeepSeek の​3モデルに​意見を​出させます。​重い​判断では、​Fugu Ultra と​ DeepSeek の​推論型モデル​(v4-pro)を​足す運用です。

Fugu は​内部で​複数の​モデルを​使い、​その​結果を​まとめて​1通で​返します。​手持ちの​AIとは​違う​見方を​1つ足せるのが​利点です。

一方で、​社内の​意見が​そろったときの​反論役は​ Fugu に​任せていません。​反論役には、​別の​モデルを​固定で​当てています。

よく​ある​質問

無料で​使えますか?

API は​有料です。​ブラウザ版の​ Sakana Chat で​無料で​試せると​報じられています​(当社未確認)。​報道では​メール登録が​要ると​されています。

月額プランと​従量課金、​どちらが​よいですか?

毎日使うなら​月額プラン、​たまに​重い​判断で​呼ぶなら​従量課金が​向きます。​当社の​利用は​月に​数回なので、​従量課金に​しています。​完走5本の​推定費用は​合計で​約2.6ドルでした。

「Max プラン」に​入れば​ Fugu Max が​使えるのですか?

使えますが、​Max プランでなくても​使えます。​Max プランは​月額200ドルの​料金プランの​名前です。​どの​月額プランでも​ Fugu・Fugu Ultra・Fugu Max の​3つが​含まれます。

Ultra と​ Max、​どちらから​試すべきですか?

費用を​抑えて​感触を​つかむなら​ Fugu Max です。​出力単価は​ Fugu Ultra の​5分の​1です。

当社は​重い​判断に​絞って​使う​ため、​品質優先の​ Fugu Ultra を​選びました。​Fugu Max は​まだ試していません。

中で​どの​モデルが​動いているか​分かりますか?​ 外せますか?

現行版の​組み合わせは​非公開です。​6月の​技術報告には、​Gemini 3.1 Pro・Claude Opus 4.8・GPT-5.5 の​名前が​ありました。​特定の​モデルを​外す設定は、​Fugu​(無印)だけで​使えます。

複数の​エージェントが​動くと、​料金が​重なりますか?

公式 FAQ では​重ならず、​関わった​最上位モデルの​単価1本だと​説明しています。​ただ​当社の​ログには、​指揮用の​トークンが​別枠で​記録されていました。​これが​請求に​入るか​どうかは、​当社では​まだ​確かめていません。

Claude Code や​ Codex から​使えますか?

Claude Code 互換の​接続口が、​7月の​ v1.1 で​公式に​案内されています。​Codex から​使えると​いう​記載は、​公式ページで​見つけられませんでした。​当社では​どちらも​使っていません。

入力した​内容は​学習に​使われますか?

公式 FAQ では、​管理画面の​設定から​いつでも​オプトアウトできます。​機密を​扱う​前に、​設定を​確認しておくと​安心です。​な​お EU・EEA では、​サービス自体が​使えません。

日本語で​問題なく​使えますか?

当社の​7本は​すべて​日本語で​質問し、​日本語で​回答を​受け取りました。​見出しや​表を​含む長い​報告書でも、​読みにくさは​ありませんでした。​公式は​日本語の​性能に​ついて​一般的な​主張を​していません。

文脈長は​どの​くらいですか?

公式ページでは、​27.2万トークンを​超えると​ Fugu Ultra の​単価が​上がると​書かれています。​上限の​数字は​公式ページで​確認できませんでした。​OpenRouter では​100万トークンと​表示されています。

失敗や​タイムアウトのとき、​費用は​かかりますか?

当社で​失敗した​1本は、​空の​質問文に​よる​エラーでした。​0秒で​返り、​トークン使用量の​記録は​ありません。​7月の​タイムアウトは​当社側で​接続を​切ったもので、​ログが​残っておらず、​請求の​有無は​分かりません。

まとめ

Fugu Ultra は、​待てる​判断にだけ呼ぶ二人目の​意見役です。

  • Sakana AI が​2026年6月に​公開した、​複数AIを​裏で​指揮する​単一の​APIモデルです
  • 完走5本の​実測は​1回11〜21分、​約0.4〜0.9ドルでした。​社内の​見積もりより​時間は​約2倍、​費用は​最大で​約4倍です
  • 料金は​従量課金の​ほか、​月額20・100・200ドルの​プランが​あります
  • 経営判断や​設計レビューなど、​誤ると​損が​大きい​仕事に​向きます
  • 中身は​非公開で、​指揮用トークンの​請求の​扱いも​まだ​確かめられていません
  • Claude や​ GPT は​そのまま​使い、​重い​判断のときだけ横に​並べます

試すなら、​まず Sakana Chat で​触り、​次に​直近の​判断を​1つ API で​投げてみてください。​API では、​待ち時間の​上限を​30分まで​見ておくと​安心です。

複数の​AIに​意見を​出させて​判断する​仕組みづくりに​関心が​あれば、​当社の​経験を​お話しできます。​ご相談は​お問い​合わせから​どうぞ。