{
  "data": [
    {
      "id": "gemma-4-12b-it",
      "name": "Gemma 4 12B Instruct",
      "created": 1785456000,
      "description": "Google's Gemma 4 12B, served natively multimodal: text, image, audio and video input with no bolt-on encoders. Full 262K context at fp8.",
      "context_length": 262144,
      "max_output_tokens": 32768,
      "input_modalities": [
        "text",
        "image",
        "audio",
        "video"
      ],
      "output_modalities": [
        "text"
      ],
      "quantization": "fp8",
      "pricing": {
        "input": 0.06,
        "output": 0.3
      },
      "supported_features": [
        "tools",
        "json_mode",
        "structured_outputs"
      ],
      "supported_sampling_parameters": [
        "temperature",
        "top_p",
        "top_k",
        "min_p",
        "stop",
        "seed",
        "frequency_penalty",
        "presence_penalty",
        "repetition_penalty",
        "logit_bias",
        "logprobs"
      ],
      "capacity_tpm": 73000,
      "is_ready": true,
      "hugging_face_id": "google/gemma-4-12B-it",
      "object": "model",
      "owned_by": "plubo"
    },
    {
      "id": "gemma-4-e4b-it",
      "name": "Gemma 4 E4B Instruct",
      "created": 1785542400,
      "description": "Gemma 4 E4B \u2014 natively multimodal (text, image, audio and video in) at 128K context, served unquantized at bf16 from Google's release weights.",
      "context_length": 131072,
      "max_output_tokens": 16384,
      "input_modalities": [
        "text",
        "image",
        "audio",
        "video"
      ],
      "output_modalities": [
        "text"
      ],
      "quantization": "bf16",
      "pricing": {
        "input": 0.04,
        "output": 0.2,
        "image": 0.12,
        "audio": 0.12
      },
      "supported_features": [
        "tools",
        "json_mode",
        "structured_outputs"
      ],
      "supported_sampling_parameters": [
        "temperature",
        "top_p",
        "top_k",
        "min_p",
        "stop",
        "seed",
        "frequency_penalty",
        "presence_penalty",
        "repetition_penalty",
        "logit_bias",
        "logprobs"
      ],
      "capacity_tpm": 67000,
      "is_ready": true,
      "hugging_face_id": "google/gemma-4-E4B-it",
      "object": "model",
      "owned_by": "plubo"
    },
    {
      "id": "gemma-4-e2b-it",
      "name": "Gemma 4 E2B Instruct",
      "created": 1785542400,
      "description": "Gemma 4 E2B \u2014 the smallest natively multimodal Gemma 4, 128K context, served unquantized at bf16. Built for high-volume classification, extraction and routing.",
      "context_length": 131072,
      "max_output_tokens": 16384,
      "input_modalities": [
        "text",
        "image",
        "audio",
        "video"
      ],
      "output_modalities": [
        "text"
      ],
      "quantization": "bf16",
      "pricing": {
        "input": 0.02,
        "output": 0.1,
        "image": 0.06,
        "audio": 0.06
      },
      "supported_features": [
        "tools",
        "json_mode",
        "structured_outputs"
      ],
      "supported_sampling_parameters": [
        "temperature",
        "top_p",
        "top_k",
        "min_p",
        "stop",
        "seed",
        "frequency_penalty",
        "presence_penalty",
        "repetition_penalty",
        "logit_bias",
        "logprobs"
      ],
      "capacity_tpm": 101000,
      "is_ready": true,
      "hugging_face_id": "google/gemma-4-E2B-it",
      "object": "model",
      "owned_by": "plubo"
    }
  ]
}
