結論(即答): Sakana Fugu とは・使った結論
Fugu Ultra は、11〜21分待てる重い判断にだけ呼ぶ「二人目の意見役」として使うのが合っています。
Sakana Fugu は、Sakana AI が2026年6月22日に公開したモデルです。複数のAIモデルを1つのAPIの裏側で使い分け、検証と統合までを Fugu 側が受け持ちます。呼び出す側からは、1つのモデルに質問しているように見えます。
当社は2026年6月に初回評価をし、7月から試験的に呼び出し、9月に社内の判断手順へ組み込みました。
当社に残る呼び出しログは7本です(完走5本・失敗1本・疎通確認1本)。完走5本から分かったことは3つです。
- 1回の回答に11〜21分かかりました
- 費用は1回あたり約0.4〜0.9ドルでした(公式単価からの推定)
- 回答は長く、結論・根拠・リスクまで構造立てて返ってきます
速さを求める場面には向きません。後戻りしにくい判断で、別の視点を1つ足したいときに役立ちます。
仕組み: 指揮役のモデルが、ほかのAIに仕事を振り分ける
Fugu の中身は、質問ごとに「どのAIに、どう解かせるか」を決める指揮役のモデルです。
公式ページの「Tech Behind」によると、土台は2026年の国際学会 ICLR に採択された2本の論文です。
- TRINITY: 軽量な指揮役が、複数のAIを数ターンにわたって動かします。各AIに Thinker(考える役)、Worker(作業する役)、Verifier(検証する役)を割り当てます
- Conductor: 強化学習で訓練した指揮役が、AI同士の連携のさせ方を自然文で組み立てます
技術報告(arXiv 2606.21228、2026年6月)には、もう少し細かい説明があります。Fugu は TRINITY と違い、選んだモデルに毎回 Worker として仕事を渡すと書かれています。
また Conductor の枠組みでは、指揮役自身を作業役として呼べます。指揮役自身を入れ子で呼ぶことで、より複雑な連携の形を作れるという説明です。
同じ報告は、6月時点の作業役として3つのモデルを挙げています。Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.5 です。ただ、現行版でどのモデルをどう組み合わせているかは非公開です。
指揮役のモデルの大きさ(パラメータ数)は、公式ページと技術報告の概要からは確認できませんでした。
モデルの種類と料金
用途に応じて3系統あり、当社が使っているのは品質優先の Fugu Ultra です。
公式ページ(sakana.ai/fugu/)の記載を表にまとめました。
| モデル | 従量課金(100万トークンあたり) | 公式が示す用途 |
|---|---|---|
| Fugu | 裏で使ったモデルの標準単価 | 日常作業。速さと品質のバランス向け |
| Fugu Max | 入力2ドル/出力6ドル/キャッシュ入力0.25ドル | 費用を抑えたい用途。Web検索1回0.007ドル |
| Fugu Ultra(現行は v2.0。発表名は Fugu Ultra v2) | 入力5ドル/出力30ドル/キャッシュ入力0.5ドル | 難しい多段階の問題。応答時間より品質を優先 |
Fugu Ultra は、文脈が27.2万トークンを超えると単価が上がります。入力10ドル、出力45ドル、キャッシュ入力1ドルです。Fugu Max は文脈の長さで単価が変わりません。
このほかに、セキュリティ分析向けの Fugu Cyber があります。料金は営業窓口への問い合わせです。
公式 FAQ には、課金について2つの説明があります。
- 複数のエージェントが動いても料金は重ならず、関わった最上位モデルの単価1本で請求される
- トークン使用量と費用はリクエストごとに報告され、支出をその場で追える
月額プラン
従量課金とは別に、月額の定額プランが3つあります。
| プラン | 月額 | 利用枠 | 公式の想定 |
|---|---|---|---|
| Standard | 20ドル | 基準量(1倍) | 軽い日常利用 |
| Pro | 100ドル | Standard の10倍 | 集中して作業する時間帯 |
| Max | 200ドル | Standard の20倍 | 重く長時間の作業 |
どのプランでも、Fugu・Fugu Ultra・Fugu Max の3つを使えます。
当社で使っているのは従量課金で、月額プランは試していません。
「Max プラン」と「Fugu Max」は別物
名前が似ていますが、Max プランは月額200ドルの料金プランです。Fugu Max は、費用を抑えたモデルの名前です。
Max プランに入ると、Fugu Max だけでなく Fugu Ultra も使えます。逆に Fugu Max は、Standard プランでも従量課金でも使えます。
無料で試す方法(Sakana Chat)
API を使わずに試すなら、ブラウザで使える Sakana Chat(chat.sakana.ai)があります。
報道によると、Sakana Chat のモデル選択で Sakana Fugu や Fugu Max を選べます。当社では確認していません。
「無料で使える」「Fugu の利用にはメール登録が要る」という条件は、報道記事に載っています。公式の告知ページでは、無料かどうかと回数の上限は確認できませんでした。
ベンチマーク(公式値)
公式の数値では、Fugu Ultra は主要な試験で当時の大手モデルと同等以上の点を出しています。
技術報告(2026年6月、初版)の表から、主要な指標を抜き出しました。
| 指標 | Fugu Ultra | Fugu | Claude Opus 4.8 | Gemini 3.1 Pro | GPT-5.5 |
|---|---|---|---|---|---|
| SWE-Bench Pro(コード修正) | 73.7 | 59.0 | 69.2 | 54.2 | 58.6 |
| GPQA-Diamond(専門知識の推論) | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| LiveCodeBench Pro(競技プログラミング) | 90.8 | 87.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam(難問総合) | 50.0 | 47.2 | 49.8 | 44.4 | 41.4 |
| Terminal Bench 2.1(端末操作) | 82.1 | 80.2 | 74.6 | 70.3 | 78.2 |
比較相手の点の一部は、各社が公表した値の引用です。
その後の更新でも数値が出ています。
- 7月24日の v1.1 では、v1.0 から最大7.9ポイント伸びたと公式が発表しました
- 9月11日の Fugu Ultra v2.0 では、図表読解の Chartography で48.3と発表されました。比較として示された Opus 5 は27.3、Fable 5 は29.5です
- 同じ発表では、指揮対象から Fable 5、Fable 5.1、GPT-6 Astra を外しています。この数値は、それらを含めずに出したものです
当社の実測: 所要時間と費用
完走した5本は、どれも11分以上かかりました。
当社の呼び出しログ7本をそのまま載せます。所要時間は、ログの作成時刻と更新時刻の差です。費用は、公式単価に応答のトークン数(prompt_tokens/completion_tokens)を掛けた推定値です。
| 日付 | 所要時間 | 入力/出力トークン | 推定費用 | 用途 |
|---|---|---|---|---|
| 9/13 | 0秒 | — | — | 失敗(質問文が空でエラー) |
| 9/13 | 9秒 | 761/197 | 約0.01ドル | 短い問いでの疎通確認 |
| 9/13 | 693秒 | 7,222/13,903 | 約0.45ドル | 自社ゲームの試遊レビュー |
| 9/13 | 663秒 | 8,104/14,338 | 約0.47ドル | 自社ゲームの試遊レビュー |
| 9/21 | 1,279秒 | 2,125/28,242 | 約0.86ドル | 自社サイトの方針審査 |
| 9/22 | 820秒 | 2,953/13,991 | 約0.43ドル | 掲載カテゴリ拡大案の検討 |
| 9/23 | 779秒 | 2,989/12,286 | 約0.38ドル | 事業のゴール定義 |
費用の大半は出力です。回答は1万2千〜2万8千トークンで、日本語にすると数万字の報告書になります。
短い問いなら9秒で返りました。所要時間と費用は、問いの中身で大きく変わります。
1本目の失敗は当社側の不備です。空の質問文を送ってしまい、API がエラーを返しました。この応答にはトークン使用量の記録がありません。
社内手順書の見積もりは「1回0.2ドル強・5〜10分」でした。実測では、時間は約2倍、費用は最大で約4倍かかっています。
これから使う方は、1回15分前後・0.4〜0.9ドルを目安にしてください。
向く仕事・向かない仕事
待ち時間と費用に見合うのは、判断を誤ったときの損が大きい仕事です。
当社では、次の表のように使い分けています。
| 使う場面 | 使わない場面 |
|---|---|
| 経営判断、高額な選択、後戻りしにくい決定 | 単純な事実確認や用語の質問 |
| 事業方針や設計のレビュー | 数分で往復したい壁打ち |
| 複数AIの議論の裁定役 | 台本・コピーなどの制作物 |
| 比較評価の決勝で出す案の一つ | 定型作業の繰り返し |
実例を1つ挙げます。7月に、3つのAIに業務改善の方針を2ラウンド議論させました。争点の裁定を Fugu Ultra に任せると、筋の通った実行計画が返ってきます。
ただ、その裁定を別のAIに批判させると、欠点も見えました。「方向は妥当。ただ、一人会社で回すには管理対象が多すぎる」という指摘です。
Fugu の答えは、そのまま採用していません。他のAIの批判にかけてから使う前提で置いています。
制作物では使っていません。台本やコピーは、別の競作手順で作っています。
始め方
OpenAI 互換の API なので、既存のコードの接続先とモデル名を変えれば動きます。
4ステップ
- キーを発行する: console.sakana.ai でアカウントを作り、API キーを発行します
- 接続先を差し替える: OpenAI の SDK などで、base URL を
https://api.sakana.ai/v1にします - モデル名を指定する: 当社で使っているのは
fugu-ultraです。ほかにfugu、fugu-max、fugu-ultra-v2.0 があります - 待ち時間の上限を長くする: 同期 API なので、回答が出るまで接続を開けたまま待ちます。当社は上限を1,800秒(30分)にしています
Python の OpenAI SDK で書くと、次のようになります。
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.sakana.ai/v1",
api_key=os.environ["SAKANA_API_KEY"],
timeout=1800, # 30分。短いと重い問いで打ち切られる
)
res = client.chat.completions.create(
model="fugu-ultra",
reasoning_effort="high",
messages=[{"role": "user", "content": "判断したい問いをここに書く"}],
)
print(res.choices[0].message.content)
print(res.usage) # 入出力トークンと、指揮用トークンの別枠
当社では、これをシェルスクリプトにまとめて呼んでいます。
fugu_ask.sh "問い" --effort high --timeout 1800
推論の深さは reasoning_effort で指定します。判断系は high、難所だけ xhigh に上げます。
待っている間に、ほかのAIへの質問を並行で進めます。1回の判断で Fugu を呼ぶのは1回までと決めています。
Claude Code から使う
2026年7月24日の v1.1 の告知で、Claude Code から Fugu を使える接続口が発表されました。いつもの Claude Code の作業の中で、Fugu に仕事を任せられるという説明です。
設定の手順は、告知ページには載っていません。console.sakana.ai の「get-started」を案内しています。
Claude Code からの利用は、当社では試していません。設定の手間や使い勝手は確認していません。
OpenRouter などほかの経路
AI モデルの取次サービス OpenRouter でも、Fugu を選べます。モデル名は次の3つです。
sakana/fugu-ultrasakana/fugu-ultra-v2sakana/fugu-max
単価は公式と同じ表示でした(2026年9月26日時点)。
当社の導入経緯
- 6月22日: 公開日に評価メモを作り、二人目の意見役という位置づけに決めました
- 7月17日: 初回の呼び出しがタイムアウトしました。待ち時間の上限が短すぎたためです
- 7月後半: 議論の裁定役や要件レビューで試しました
- 9月13日: 呼び出し用スクリプトを整え、疎通を確かめました
- 現在は、重い判断で複数AIに意見を出させる手順の標準メンバーです
注意点と未確認のこと
中身が見えないこと、請求の内訳が読み切れないことは、当社でも未解決です。
中で動くモデルは非公開です。 6月の技術報告には作業役のモデル名がありました。一方で、現行版の組み合わせは公開されていません。
そのため、答えが良かった理由も悪かった理由も追いかけられません。
指揮用トークンの扱いは、読み切れていません。 公式 FAQ は「料金は最上位モデルの単価1本」「費用はリクエストごとに報告」と説明しています。
当社のログでは、応答の usage に入出力トークンが記録されていました。その内訳の欄に、指揮用のトークンが別枠で載っています。
指揮用トークンの別枠は、完走5本で入力3.4万〜5万、出力2.8万〜3.8万でした。応答の中に、費用の金額そのものは入っていませんでした。
当社の推定費用は、入出力トークンだけに単価を掛けたものです。仮に指揮用トークンも同じ単価で請求されると、1本あたり約1.5〜2.3ドルになります。
どちらが正しいかは、管理画面の請求額と比べないと分かりません。この確認はまだできていません。
ベンチマークは再現していません。 上の数字は公式の発表です。比較相手の一部は各社の公表値の引用です。
一部の非公開モデルは含まれていません。 公式によると、Anthropic の Fable 5 などは指揮対象外です。比較するときは、この点を踏まえてください。
EU・EEA では使えません。 公式 FAQ によると、GDPR(EU の個人データ保護規則)への対応作業中のためです。
入出力の学習利用は断れます。 公式 FAQ では、管理画面の設定からいつでもオプトアウトできると書かれています。
特定のモデルを外せるのは Fugu だけです。 公式 FAQ では、Fugu は特定のモデルや提供元を候補から外せます。Fugu Ultra と Fugu Max は候補が固定です。
文脈長は出所で表記が違います。 公式ページは、Fugu Ultra の単価が変わる境目として27.2万トークンを示しています。文脈長の上限そのものは、公式ページでは確認できませんでした。
OpenRouter の一覧では、Fugu Ultra の文脈長は100万トークンです。出力の上限は12.8万トークンと表示されています(2026年9月26日時点)。
出所が個人・第三者の主張も出回っています。
- 「別モデルが拾えなかったバグ27件を1時間で見つけた」は、公開初日の個人の報告です
- 「デザインは他モデルに大きく劣る」も、同じ方の個人の報告です
当社ではどちらも検証していません。完走5本の試用だけで、他モデルとの同一条件での比較も未実施です。
日本語について、公式は一般的な性能をうたっていません。当社の7本はすべて日本語でやり取りし、回答の日本語に困る場面はありませんでした。
Claude / GPT との関係(置き換えではなく足すもの)
当社では、Claude や GPT の代わりに使わず、隣に一人足す形で使っています。
Sakana AI は、東京を拠点とする AI 企業です。「Building Frontier AI in Japan」を掲げています。Fugu のほかに、日本語向けモデルの Namazu なども出しています。
日常の実装や調べ物の主力は、Claude と GPT です。数秒から数分で返るので、往復の多い作業に向きます。
Fugu Ultra は1回15分前後かかります。この速さでは、日々の作業の主力にはなりません。
役に立つのは、複数のAIに同じ問いを投げて比べる場面です。当社の手順では GPT、Grok、DeepSeek の3モデルに意見を出させます。重い判断では、Fugu Ultra と DeepSeek の推論型モデル(v4-pro)を足す運用です。
Fugu は内部で複数のモデルを使い、その結果をまとめて1通で返します。手持ちのAIとは違う見方を1つ足せるのが利点です。
一方で、社内の意見がそろったときの反論役は Fugu に任せていません。反論役には、別のモデルを固定で当てています。
よくある質問
無料で使えますか?
API は有料です。ブラウザ版の Sakana Chat で無料で試せると報じられています(当社未確認)。報道ではメール登録が要るとされています。
月額プランと従量課金、どちらがよいですか?
毎日使うなら月額プラン、たまに重い判断で呼ぶなら従量課金が向きます。当社の利用は月に数回なので、従量課金にしています。完走5本の推定費用は合計で約2.6ドルでした。
「Max プラン」に入れば Fugu Max が使えるのですか?
使えますが、Max プランでなくても使えます。Max プランは月額200ドルの料金プランの名前です。どの月額プランでも Fugu・Fugu Ultra・Fugu Max の3つが含まれます。
Ultra と Max、どちらから試すべきですか?
費用を抑えて感触をつかむなら Fugu Max です。出力単価は Fugu Ultra の5分の1です。
当社は重い判断に絞って使うため、品質優先の Fugu Ultra を選びました。Fugu Max はまだ試していません。
中でどのモデルが動いているか分かりますか? 外せますか?
現行版の組み合わせは非公開です。6月の技術報告には、Gemini 3.1 Pro・Claude Opus 4.8・GPT-5.5 の名前がありました。特定のモデルを外す設定は、Fugu(無印)だけで使えます。
複数のエージェントが動くと、料金が重なりますか?
公式 FAQ では重ならず、関わった最上位モデルの単価1本だと説明しています。ただ当社のログには、指揮用のトークンが別枠で記録されていました。これが請求に入るかどうかは、当社ではまだ確かめていません。
Claude Code や Codex から使えますか?
Claude Code 互換の接続口が、7月の v1.1 で公式に案内されています。Codex から使えるという記載は、公式ページで見つけられませんでした。当社ではどちらも使っていません。
入力した内容は学習に使われますか?
公式 FAQ では、管理画面の設定からいつでもオプトアウトできます。機密を扱う前に、設定を確認しておくと安心です。なお EU・EEA では、サービス自体が使えません。
日本語で問題なく使えますか?
当社の7本はすべて日本語で質問し、日本語で回答を受け取りました。見出しや表を含む長い報告書でも、読みにくさはありませんでした。公式は日本語の性能について一般的な主張をしていません。
文脈長はどのくらいですか?
公式ページでは、27.2万トークンを超えると Fugu Ultra の単価が上がると書かれています。上限の数字は公式ページで確認できませんでした。OpenRouter では100万トークンと表示されています。
失敗やタイムアウトのとき、費用はかかりますか?
当社で失敗した1本は、空の質問文によるエラーでした。0秒で返り、トークン使用量の記録はありません。7月のタイムアウトは当社側で接続を切ったもので、ログが残っておらず、請求の有無は分かりません。
まとめ
Fugu Ultra は、待てる判断にだけ呼ぶ二人目の意見役です。
- Sakana AI が2026年6月に公開した、複数AIを裏で指揮する単一のAPIモデルです
- 完走5本の実測は1回11〜21分、約0.4〜0.9ドルでした。社内の見積もりより時間は約2倍、費用は最大で約4倍です
- 料金は従量課金のほか、月額20・100・200ドルのプランがあります
- 経営判断や設計レビューなど、誤ると損が大きい仕事に向きます
- 中身は非公開で、指揮用トークンの請求の扱いもまだ確かめられていません
- Claude や GPT はそのまま使い、重い判断のときだけ横に並べます
試すなら、まず Sakana Chat で触り、次に直近の判断を1つ API で投げてみてください。API では、待ち時間の上限を30分まで見ておくと安心です。
複数のAIに意見を出させて判断する仕組みづくりに関心があれば、当社の経験をお話しできます。ご相談はお問い合わせからどうぞ。