> ## Documentation Index
> Fetch the complete documentation index at: https://wb-21fd5541-dependabot-npm-and-yarn-scripts-css-minify-npm.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 利用可能なモデル

> Serverless Inference で利用できる基盤モデルを確認


Serverless Inference では、複数のオープンソース基盤モデルを利用できます。各モデルには、それぞれ異なる強みとユースケースがあります。

<h2 id="generally-available-models">
  一般提供されているモデル
</h2>

次のモデルは[一般提供](/ja/inference/lifecycle#model-lifecycle-stages)されています：

| モデル | モデル ID (API 使用時) | タイプ | コンテキストウィンドウ | パラメーター | 説明 |
| - | - | - | - | - | - |
| DeepSeek V4.1-Flash | `deepseek-ai/DeepSeek-V4.1-Flash` | テキスト、画像 | 1049k | 16B-552B (アクティブ-合計) | DeepSeek V4.1 Flash は、長いコンテキストを扱える、コーディング、推論、エージェント型ワークロード向けのマルチモーダル MoE モデルです。 |
| DeepSeek V4-Flash-0731 | `deepseek-ai/DeepSeek-V4-Flash-0731` | テキスト | 262k | 13B-284B (アクティブ-合計) | DeepSeek V4-Flash-0731 は、コーディング、推論、エージェント型ワークロードに適した MoE モデルです。 |
| DeepSeek V4-Pro-0813 | `deepseek-ai/DeepSeek-V4-Pro-0813` | テキスト | 1049k | 49B-1.6T (アクティブ-合計) | DeepSeek V4-Pro-0813は、1.6TパラメーターのMoEモデルで、高度な推論、コーディング、複雑なエージェント型ワークロードに優れています。 |
| DeepSeek V3.1 | `deepseek-ai/DeepSeek-V3.1` | テキスト | 161k | 37B-671B (アクティブ-合計) | プロンプトテンプレートを通じて、思考モードと思考なしモードの両方をサポートする大規模なハイブリッドモデル。 |
| Google Gemma 4 31B | `google/gemma-4-31B-it` | テキスト、画像 | 262k | 31B (合計) | Gemma 4 31B Dense は、高度な推論、エージェント型ワークフロー、長いコンテキストに対応するよう設計されており、140 以上の言語でネイティブにトレーニングされています。 |
| Google Gemma 4 26B A4B Instruct | `google/gemma-4-26B-A4B-it` | テキスト、画像 | 262k | 4B-26B (アクティブ-合計) | Gemma 4 26B A4B は、LoRA アダプターとエージェント型ワークフロー向けの関数呼び出しに対応したマルチモーダル MoE モデルです。 |
| IBM Granite 4.2 8B | `ibm-granite/granite-4.2-8b` | テキスト | 131k | 8B (合計) | Granite 4.2 8B は、強化されたツール呼び出し、指示追従、チャット機能を備えた Instruct モデルです。 |
| Meta Llama 3.3 70B | `meta-llama/Llama-3.3-70B-Instruct` | テキスト | 128k | 70B (合計) | 会話タスク、詳細な指示への追従、コーディングに優れた多言語モデル。 |
| Meta Llama 3.1 8B | `meta-llama/Llama-3.1-8B-Instruct` | テキスト | 131k | 8B (合計) | 応答性の高い多言語チャットボット向けに最適化された、効率的な会話モデル。 |
| MiniMax M3 | `MiniMaxAI/MiniMax-M3` | テキスト、画像 | 262k | 23B-428B (アクティブ-合計) | MiniMax M3 は、23B のアクティブパラメーターを備え、コーディングやエージェント型ワークフロー向けに最適化されたマルチモーダル MoE モデルです。 |
| Moonshot AI Kimi K2.7 Code | `moonshotai/Kimi-K2.7-Code` | テキスト、画像 | 262k | 32B-1T (アクティブ-合計) | Kimi K2.7 Code は、320億のアクティブパラメーターと合計1兆のパラメーターを備え、長期間にわたるエージェント型コーディングとソフトウェアエンジニアリング向けに特化した MoE モデルです。 |
| Moonshot AI Kimi K2.6 | `moonshotai/Kimi-K2.6` | テキスト、画像 | 262k | 32B-1T (アクティブ-合計) | Kimi K2.6 は、320億のアクティブパラメーターと合計1兆のパラメーターを備えた、マルチモーダルのMixture-of-Experts言語モデルです。 |
| NVIDIA Nemotron 3.5 Lightning | `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B` | テキスト | 262k | 3B-30B (アクティブ-合計) | Nemotron 3.5 Lightning は、金融サービス、サイバーセキュリティ、通信、小売などのユースケースにおいて、高速かつ信頼性の高いエージェント型タスク向けに構築された MoE モデルです。 |
| NVIDIA Nemotron 3 Ultra | `nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B` | テキスト | 262k | 55B-550B (アクティブ-合計) | Nemotron 3 Ultra は、コーディング、ディープリサーチ、エンタープライズオートメーションにおける長時間動作するエージェント向けに設計された、強力な MoE モデルです。 |
| OpenAI GPT OSS 120B | `openai/gpt-oss-120b` | テキスト | 131k | 5.1B-117B (アクティブ-合計) | 高度な推論、エージェント型、および汎用のユースケース向けに設計された、効率的なMixture-of-Expertsモデル。 |
| OpenAI GPT OSS 20B | `openai/gpt-oss-20b` | テキスト | 131k | 36億～200億 (アクティブ～総計) | OpenAIのHarmonyレスポンス形式でトレーニングされた、推論能力を備える低レイテンシのMixture-of-Expertsモデル。 |
| Qwen3.8 27B | `Qwen/Qwen3.8-27B` | テキスト、ビジョン | 262k | 27B (合計) | Qwen3.8-27B は、コーディング、研究、ビジョン、長時間にわたるエージェントタスクに適した高密度マルチモーダルモデルです。 |
| Qwen3.6 35B A3B | `Qwen/Qwen3.6-35B-A3B` | テキスト、ビジョン | 262k | 3B-35B (アクティブ-総計) | Qwen3.6-35B-A3B は、エージェント型コーディングワークフロー向けに最適化された、262K コンテキストの MoE マルチモーダルモデルです。 |
| Z.AI GLM 5.3 Flash | `zai-org/GLM-5.3-Flash` | テキスト、ビジョン | 1049k | 18B-320B (アクティブ-合計) | GLM-5.3-Flash は、合計3,200億個のパラメーターと180億個の実行中パラメーターを備えた、ネイティブにマルチモーダルなモデルです。 |
| Z.AI GLM 5.2 | `zai-org/GLM-5.2` | テキスト | 1049k | 40B-744B (アクティブ-合計) | GLM-5.2 は、400億のアクティブパラメーターと合計7,440億のパラメーターを備えたMixture-of-Experts言語モデルです。 |

<h2 id="experimental-models">
  実験的なモデル
</h2>

以下のモデルは[実験的](/ja/inference/lifecycle#model-lifecycle-stages)です：

*現在のところありません*

<h2 id="deprecated-models">
  非推奨のモデル
</h2>

以下のモデルは[非推奨](/ja/inference/lifecycle#model-lifecycle-stages)です。

| モデル | モデル ID (API で使用) | タイプ | コンテキストウィンドウ | パラメーター | 説明 |
| - | - | - | - | - | - |
| DeepSeek V4-Flash | `deepseek-ai/DeepSeek-V4-Flash` | テキスト | 1049k | 13B-284B (アクティブ-合計) | DeepSeek V4-Flash は 100 万コンテキスト長の MoE モデルで、コーディング、推論、エージェント型ワークロードに優れています。 |
| DeepSeek V4-Pro | `deepseek-ai/DeepSeek-V4-Pro` | テキスト | 1049k | 49B-1.6T (アクティブ-合計) | DeepSeek V4-Pro は 49B のアクティブパラメーターを持つ 1.6T パラメーターの MoE モデルで、高度な推論、コーディング、複雑なエージェント型ワークロードに優れています。 |
| IBM Granite 4.1 8B | `ibm-granite/granite-4.1-8b` | テキスト | 131k | 8B (合計) | Granite 4.1 8B はロングコンテキスト対応の instruct モデルで、強化されたツール呼び出し、指示追従、チャットの各機能を備えています。 |
| JetBrains Mellum2 12B A2.5B | `JetBrains/Mellum2-12B-A2.5B-Instruct` | テキスト | 131k | 2.5B-12B (アクティブ-合計) | Mellum2-12B-A2.5B-Instruct は 131K コンテキストを備えた高速な MoE モデルで、コーディング、ツールの使用、低レイテンシーの AI ワークフロー向けに構築されています。 |
| Meta Llama 3.1 70B | `meta-llama/Llama-3.1-70B-Instruct` | テキスト | 131k | 70B (合計) | 応答性の高い多言語チャットボット対話向けに最適化された、効率的な会話モデルです。 |
| OpenPipe Qwen3 14B Instruct | `OpenPipe/Qwen3-14B-Instruct` | テキスト | 32.8k | 14.8B (合計) | ファインチューニングによるエージェント構築向けに OpenPipe が最適化した、効率的で多言語対応の密なインストラクションチューニング済みモデルです。 |
| Qwen3.6 27B | `Qwen/Qwen3.6-27B` | テキスト、ビジョン | 262k | 27B (合計) | Qwen3.6-27B は 262K コンテキストを備えた 27B の密なマルチモーダルモデルで、フラッグシップレベルのエージェント型コーディング向けに構築されています。 |
| Qwen3.5 35B A3B | `Qwen/Qwen3.5-35B-A3B` | テキスト、ビジョン | 262k | 3B-35B (アクティブ-合計) | Qwen3.5-35B-A3B はオープンウェイトのマルチモーダル MoE モデルで、チャット、推論、エージェント型タスクにわたり効率的で高スループットな推論を実現するように構築されています。 |
| Qwen3 30B A3B | `Qwen/Qwen3-30B-A3B-Instruct-2507` | テキスト | 262k | 3.3B-30.5B (アクティブ-合計) | Qwen3-30B-A3B-Instruct-2507 は 30.5B の MoE インストラクションチューニング済みモデルで、推論、コーディング、ロングコンテキスト理解が強化されています。 |

<h2 id="use-model-ids">
  モデル ID を使用する
</h2>

API を呼び出してモデルを指定するには、前述の表にある `Model ID` を使用します。たとえば:

```python theme={null}
response = client.chat.completions.create(
    model="meta-llama/Llama-3.1-8B-Instruct",
    messages=[...]
)
```

<h2 id="next-steps">
  次のステップ
</h2>

モデルを選択したら、次のいずれかのリソースを参照してください。

* 各モデルの[利用制限と料金](/ja/inference/usage-limits/)を確認してください。
* これらのモデルの使い方については、[API リファレンス](/ja/inference/api-reference/)を参照してください。
* [W\&B Playground](/ja/inference/ui-guide/)でモデルを試してください。
