[
  {
    "name": "bitnet-embedding-0.6b",
    "company": "microsoft",
    "release_date": "2026-07-15",
    "model_release_at": {
      "value": "2026-07-15",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/microsoft/bitnet-embedding-0.6b",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-15",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/microsoft/bitnet-embedding-0.6b",
    "description": "",
    "category": "Major Release",
    "slug": "bitnet-embedding-0-6b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "bitnet-embedding-270m",
    "company": "microsoft",
    "release_date": "2026-07-15",
    "model_release_at": {
      "value": "2026-07-15",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/microsoft/bitnet-embedding-270m",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-15",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/microsoft/bitnet-embedding-270m",
    "description": "",
    "category": "Major Release",
    "slug": "bitnet-embedding-270m",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Nemotron-3-Embed-1B-NVFP4",
    "company": "nvidia",
    "release_date": "2026-07-14",
    "model_release_at": {
      "value": "2026-07-14",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/nvidia/Nemotron-3-Embed-1B-NVFP4",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-14",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/nvidia/Nemotron-3-Embed-1B-NVFP4",
    "description": "",
    "category": "Major Release",
    "slug": "nemotron-3-embed-1b-nvfp4",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "UniVR-34B-Planning",
    "company": "ByteDance",
    "release_date": "2026-07-13",
    "model_release_at": {
      "value": "2026-07-13",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/ByteDance/UniVR-34B-Planning",
      "retrieved_at": "2026-07-13T12:06:12Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-13",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/ByteDance/UniVR-34B-Planning",
    "description": "",
    "category": "Major Release",
    "slug": "univr-34b-planning",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "nvDock",
    "company": "nvidia",
    "release_date": "2026-07-08",
    "model_release_at": {
      "value": "2026-07-08",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/nvidia/nvDock",
      "retrieved_at": "2026-07-08T13:03:08Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-08",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/nvidia/nvDock",
    "description": "",
    "category": "Major Release",
    "slug": "nvdock",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "CWIP-1.0",
    "company": "nvidia",
    "release_date": "2026-07-07",
    "model_release_at": {
      "value": "2026-07-07",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/nvidia/CWIP-1.0",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-07",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/nvidia/CWIP-1.0",
    "description": "",
    "category": "Major Release",
    "slug": "cwip-1-0",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "HARC-Qwen2.5-7B-Instruct",
    "company": "microsoft",
    "release_date": "2026-07-02",
    "model_release_at": {
      "value": "2026-07-02",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/microsoft/HARC-Qwen2.5-7B-Instruct",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-02",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/microsoft/HARC-Qwen2.5-7B-Instruct",
    "description": "",
    "category": "Major Release",
    "slug": "harc-qwen2-5-7b-instruct",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Leanstral-1.5-119B-A6B",
    "company": "mistralai",
    "release_date": "2026-07-01",
    "model_release_at": {
      "value": "2026-07-01",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/mistralai/Leanstral-1.5-119B-A6B",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-07-01",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/mistralai/Leanstral-1.5-119B-A6B",
    "description": "",
    "category": "Major Release",
    "slug": "leanstral-1-5-119b-a6b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "DeepSeek-V4-Flash-DSpark",
    "company": "deepseek-ai",
    "release_date": "2026-06-27",
    "model_release_at": {
      "value": "2026-06-27",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-DSpark",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-27",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-DSpark",
    "description": "",
    "category": "Major Release",
    "slug": "deepseek-v4-flash-dspark",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "DeepSeek-V4-Pro-DSpark",
    "company": "deepseek-ai",
    "release_date": "2026-06-27",
    "model_release_at": {
      "value": "2026-06-27",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-27",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark",
    "description": "",
    "category": "Major Release",
    "slug": "deepseek-v4-pro-dspark",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Kimi-K2.6-DFlash",
    "company": "nvidia",
    "release_date": "2026-06-23",
    "model_release_at": {
      "value": "2026-06-23",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/nvidia/Kimi-K2.6-DFlash",
      "retrieved_at": "2026-07-13T12:06:12Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-23",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/nvidia/Kimi-K2.6-DFlash",
    "description": "",
    "category": "Major Release",
    "slug": "kimi-k2-6-dflash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "EvoQuality",
    "company": "ByteDance",
    "release_date": "2026-06-10",
    "model_release_at": {
      "value": "2026-06-10",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/ByteDance/EvoQuality",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-10",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/ByteDance/EvoQuality",
    "description": "",
    "category": "Major Release",
    "slug": "evoquality",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude Fable 5",
    "company": "Anthropic",
    "release_date": "2026-06-09",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "92.6%",
      "HLE": "53.3%",
      "SciCode": "60.2%",
      "TAU2-bench": "98.5%",
      "TerminalBench-Hard": "62.9%",
      "IF-Bench": "63.5%",
      "LiveCodeBench Reasoning": "70.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-fable-5-mythos-5",
    "description": "Anthropic Claude Fable 5 — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "claude-fable-5",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$10.00",
      "output_per_mtok": "$50.00",
      "cache_read_per_mtok": "$1.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "92.6%",
      "HLE": "53.3%",
      "SciCode": "60.2%",
      "TAU2-bench": "98.5%",
      "TerminalBench-Hard": "62.9%",
      "IF-Bench": "63.5%",
      "LiveCodeBench Reasoning": "70.0%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-fable-5-mythos-5"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "North Mini Code",
    "company": "Cohere",
    "release_date": "2026-06-09",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "75.7%",
      "HLE": "9.9%",
      "SciCode": "38.2%",
      "TAU2-bench": "37.4%",
      "TerminalBench-Hard": "31.1%",
      "IF-Bench": "57.6%",
      "LiveCodeBench Reasoning": "32.3%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Cohere North Mini Code — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "north-mini-code",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "75.7%",
      "HLE": "9.9%",
      "SciCode": "38.2%",
      "TAU2-bench": "37.4%",
      "TerminalBench-Hard": "31.1%",
      "IF-Bench": "57.6%",
      "LiveCodeBench Reasoning": "32.3%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "diffusiongemma-26B-A4B-it",
    "company": "google",
    "release_date": "2026-06-09",
    "model_release_at": {
      "value": "2026-06-09",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/google/diffusiongemma-26B-A4B-it",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-09",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/google/diffusiongemma-26B-A4B-it",
    "description": "",
    "category": "Major Release",
    "slug": "diffusiongemma-26b-a4b-it",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "gemma-4-12B-it-qat-q4_0-gguf",
    "company": "google",
    "release_date": "2026-06-05",
    "model_release_at": {
      "value": "2026-06-05",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/google/gemma-4-12B-it-qat-q4_0-gguf",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-05",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/google/gemma-4-12B-it-qat-q4_0-gguf",
    "description": "",
    "category": "Major Release",
    "slug": "gemma-4-12b-it-qat-q4-0-gguf",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemma 4 12B",
    "company": "Google",
    "release_date": "2026-06-03",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "75.3%",
      "HLE": "14.6%",
      "SciCode": "38.2%",
      "TAU2-bench": "34.8%",
      "TerminalBench-Hard": "18.2%",
      "IF-Bench": "73.5%",
      "LiveCodeBench Reasoning": "55.3%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Google Gemma 4 12B — 131K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gemma-4-12b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "131K tokens",
    "max_output_tokens": "200K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "75.3%",
      "HLE": "14.8%",
      "SciCode": "38.2%",
      "TAU2-bench": "36.3%",
      "TerminalBench-Hard": "18.2%",
      "IF-Bench": "73.5%",
      "LiveCodeBench Reasoning": "55.3%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "new capabilities to GPT-Rosalind",
    "company": "OpenAI",
    "release_date": "2026-06-03",
    "model_release_at": {
      "value": "2026-06-03",
      "source": "Lab announcement (RSS)",
      "source_url": "https://openai.com/index/introducing-new-capabilities-to-gpt-rosalind",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-03",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://openai.com/index/introducing-new-capabilities-to-gpt-rosalind",
    "description": "",
    "category": "Major Release",
    "slug": "new-capabilities-to-gpt-rosalind",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "HARC",
    "company": "microsoft",
    "release_date": "2026-06-02",
    "model_release_at": {
      "value": "2026-06-02",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/microsoft/HARC",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-02",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/microsoft/HARC",
    "description": "",
    "category": "Major Release",
    "slug": "harc",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "gemma-4-E2B-it-qat-mobile-transformers",
    "company": "google",
    "release_date": "2026-06-02",
    "model_release_at": {
      "value": "2026-06-02",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/google/gemma-4-E2B-it-qat-mobile-transformers",
      "retrieved_at": "2026-07-13T12:06:12Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-02",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/google/gemma-4-E2B-it-qat-mobile-transformers",
    "description": "",
    "category": "Major Release",
    "slug": "gemma-4-e2b-it-qat-mobile-transformers",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "gemma-4-E4B-it-qat-mobile-transformers",
    "company": "google",
    "release_date": "2026-06-02",
    "model_release_at": {
      "value": "2026-06-02",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/google/gemma-4-E4B-it-qat-mobile-transformers",
      "retrieved_at": "2026-07-13T12:06:12Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-02",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/google/gemma-4-E4B-it-qat-mobile-transformers",
    "description": "",
    "category": "Major Release",
    "slug": "gemma-4-e4b-it-qat-mobile-transformers",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Qwen3.7 Plus",
    "company": "Alibaba",
    "release_date": "2026-06-01",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "90.0%",
      "HLE": "33.4%",
      "SciCode": "45.5%",
      "TAU2-bench": "93.0%",
      "TerminalBench-Hard": "47.0%",
      "IF-Bench": "78.0%",
      "LiveCodeBench Reasoning": "65.0%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "Alibaba Qwen3.7 Plus — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "qwen3-7-plus",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.40",
      "output_per_mtok": "$1.16",
      "cache_read_per_mtok": "$0.08"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "90.0%",
      "HLE": "33.4%",
      "SciCode": "45.5%",
      "TAU2-bench": "93.0%",
      "TerminalBench-Hard": "47.0%",
      "IF-Bench": "78.0%",
      "LiveCodeBench Reasoning": "65.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "MiniMax-M3",
    "company": "MiniMax",
    "release_date": "2026-06-01",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "92.9%",
      "HLE": "37.1%",
      "SciCode": "45.4%",
      "TAU2-bench": "88.9%",
      "TerminalBench-Hard": "42.4%",
      "IF-Bench": "82.9%",
      "LiveCodeBench Reasoning": "74.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.minimax.io/models/text/m3",
    "description": "MiniMax MiniMax-M3 — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "minimax-m3",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "511K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.30",
      "output_per_mtok": "$1.20",
      "cache_read_per_mtok": "$0.06"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "92.9%",
      "HLE": "37.1%",
      "SciCode": "45.4%",
      "TAU2-bench": "88.9%",
      "TerminalBench-Hard": "42.4%",
      "IF-Bench": "82.9%",
      "LiveCodeBench Reasoning": "74.0%"
    },
    "links": {
      "blog": "https://www.minimax.io/models/text/m3"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Mellum2",
    "company": "Hugging Face",
    "release_date": "2026-06-01",
    "model_release_at": {
      "value": "2026-06-01",
      "source": "Lab announcement (RSS)",
      "source_url": "https://huggingface.co/blog/JetBrains/mellum2-launch",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-01",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/blog/JetBrains/mellum2-launch",
    "description": "",
    "category": "Major Release",
    "slug": "mellum2",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "gemma-4-E2B-it-qat-mobile-ct",
    "company": "google",
    "release_date": "2026-06-01",
    "model_release_at": {
      "value": "2026-06-01",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/google/gemma-4-E2B-it-qat-mobile-ct",
      "retrieved_at": "2026-07-13T12:06:12Z",
      "verification": "lab-reported",
      "model_release_at": "2026-06-01",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/google/gemma-4-E2B-it-qat-mobile-ct",
    "description": "",
    "category": "Major Release",
    "slug": "gemma-4-e2b-it-qat-mobile-ct",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Step 3.7 Flash",
    "company": "StepFun",
    "release_date": "2026-05-29",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "80.9%",
      "HLE": "19.9%",
      "SciCode": "40.0%",
      "TAU2-bench": "98.5%",
      "TerminalBench-Hard": "35.6%",
      "IF-Bench": "67.3%",
      "LiveCodeBench Reasoning": "63.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "StepFun Step 3.7 Flash — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "step-3-7-flash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "256K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.20",
      "output_per_mtok": "$1.15",
      "cache_read_per_mtok": "$0.04"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "80.9%",
      "HLE": "19.9%",
      "SciCode": "40.0%",
      "TAU2-bench": "98.5%",
      "TerminalBench-Hard": "35.6%",
      "IF-Bench": "67.3%",
      "LiveCodeBench Reasoning": "63.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude Opus 4.8",
    "company": "Anthropic",
    "release_date": "2026-05-28",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "92.0%",
      "HLE": "45.7%",
      "SciCode": "53.5%",
      "TAU2-bench": "94.4%",
      "TerminalBench-Hard": "58.3%",
      "IF-Bench": "62.2%",
      "LiveCodeBench Reasoning": "67.7%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "Anthropic Claude Opus 4.8 — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "claude-opus-4-8",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$6.25",
      "output_per_mtok": "$25.00",
      "cache_read_per_mtok": "$0.50"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "92.0%",
      "HLE": "45.7%",
      "SciCode": "53.5%",
      "TAU2-bench": "94.4%",
      "TerminalBench-Hard": "58.3%",
      "IF-Bench": "62.2%",
      "LiveCodeBench Reasoning": "67.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "LFM2.5-8B-A1B",
    "company": "Liquid AI",
    "release_date": "2026-05-28",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "51.3%",
      "HLE": "6.9%",
      "SciCode": "7.8%",
      "TAU2-bench": "16.1%",
      "TerminalBench-Hard": "4.5%",
      "IF-Bench": "55.6%",
      "LiveCodeBench Reasoning": "0.0%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Liquid AI LFM2.5-8B-A1B — 32K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "lfm2-5-8b-a1b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "32K tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "lfm 1.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "51.3%",
      "HLE": "6.9%",
      "SciCode": "7.8%",
      "TAU2-bench": "16.1%",
      "TerminalBench-Hard": "4.5%",
      "IF-Bench": "55.6%",
      "LiveCodeBench Reasoning": "0.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "HyperNova 60B 2605",
    "company": "Multiverse Computing",
    "release_date": "2026-05-26",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "73.3%",
      "HLE": "15.1%",
      "SciCode": "33.0%",
      "TAU2-bench": "63.2%",
      "TerminalBench-Hard": "23.5%",
      "IF-Bench": "66.5%",
      "LiveCodeBench Reasoning": "31.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Multiverse Computing HyperNova 60B 2605 — 131K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "hypernova-60b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "131K tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.04",
      "output_per_mtok": "$0.14"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "73.3%",
      "HLE": "15.1%",
      "SciCode": "33.0%",
      "TAU2-bench": "63.2%",
      "TerminalBench-Hard": "23.5%",
      "IF-Bench": "66.5%",
      "LiveCodeBench Reasoning": "31.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "MiniCPM5-1B",
    "company": "OpenBMB",
    "release_date": "2026-05-25",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "26.9%",
      "HLE": "4.6%",
      "SciCode": "1.4%",
      "TAU2-bench": "82.5%",
      "TerminalBench-Hard": "0.0%",
      "IF-Bench": "35.2%",
      "LiveCodeBench Reasoning": "4.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "OpenBMB MiniCPM5-1B — 128K tokens context.",
    "category": "Major Release",
    "slug": "minicpm5-1b-non-reasoning",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "apache-2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "27.8%",
      "HLE": "6.5%",
      "SciCode": "4.4%",
      "TAU2-bench": "81.0%",
      "TerminalBench-Hard": "0.0%",
      "IF-Bench": "49.3%",
      "LiveCodeBench Reasoning": "3.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Qwen3.7 Max",
    "company": "Alibaba",
    "release_date": "2026-05-19",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "92.3%",
      "HLE": "38.1%",
      "SciCode": "48.8%",
      "TAU2-bench": "94.7%",
      "TerminalBench-Hard": "50.8%",
      "IF-Bench": "80.5%",
      "LiveCodeBench Reasoning": "69.0%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "Alibaba Qwen3.7 Max — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "qwen3-7-max",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$2.50",
      "output_per_mtok": "$7.50",
      "cache_read_per_mtok": "$0.25"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "92.3%",
      "HLE": "38.1%",
      "SciCode": "48.8%",
      "TAU2-bench": "94.7%",
      "TerminalBench-Hard": "50.8%",
      "IF-Bench": "80.5%",
      "LiveCodeBench Reasoning": "69.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemini 3.5 Flash",
    "company": "Google",
    "release_date": "2026-05-19",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "92.2%",
      "HLE": "41.0%",
      "SciCode": "53.1%",
      "TAU2-bench": "95.3%",
      "TerminalBench-Hard": "40.9%",
      "IF-Bench": "76.3%",
      "LiveCodeBench Reasoning": "69.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5/",
    "description": "Google Gemini 3.5 Flash — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gemini-3-5-flash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$1.50",
      "output_per_mtok": "$9.00",
      "cache_read_per_mtok": "$0.15"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "82.8%",
      "HLE": "23.1%",
      "SciCode": "48.8%",
      "TAU2-bench": "58.8%",
      "TerminalBench-Hard": "46.2%",
      "IF-Bench": "47.3%",
      "LiveCodeBench Reasoning": "53.3%"
    },
    "links": {
      "blog": "https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "the Ettin Reranker Family",
    "company": "Hugging Face",
    "release_date": "2026-05-19",
    "model_release_at": {
      "value": "2026-05-19",
      "source": "Lab announcement (RSS)",
      "source_url": "https://huggingface.co/blog/ettin-reranker",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-05-19",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/blog/ettin-reranker",
    "description": "",
    "category": "Major Release",
    "slug": "the-ettin-reranker-family",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "SAME-L",
    "company": "stabilityai",
    "release_date": "2026-05-17",
    "model_release_at": {
      "value": "2026-05-17",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/stabilityai/SAME-L",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-05-17",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/stabilityai/SAME-L",
    "description": "",
    "category": "Major Release",
    "slug": "same-l",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "JT-35B-Flash",
    "company": "China Mobile",
    "release_date": "2026-05-14",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "82.9%",
      "HLE": "6.1%",
      "SciCode": "29.1%",
      "TAU2-bench": "99.1%",
      "TerminalBench-Hard": "28.8%",
      "IF-Bench": "42.0%",
      "LiveCodeBench Reasoning": "55.3%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "China Mobile JT-35B-Flash — 256K tokens context.",
    "category": "Major Release",
    "slug": "jt-35b-flash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "82.9%",
      "HLE": "6.1%",
      "SciCode": "29.1%",
      "TAU2-bench": "99.1%",
      "TerminalBench-Hard": "28.8%",
      "IF-Bench": "42.0%",
      "LiveCodeBench Reasoning": "55.3%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "MiniCPM-V 4.6 1.3B",
    "company": "OpenBMB",
    "release_date": "2026-05-11",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "30.5%",
      "HLE": "4.9%",
      "SciCode": "2.1%",
      "TAU2-bench": "87.7%",
      "TerminalBench-Hard": "0.0%",
      "IF-Bench": "26.7%",
      "LiveCodeBench Reasoning": "6.3%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "OpenBMB MiniCPM-V 4.6 1.3B — 262K tokens context.",
    "category": "Major Release",
    "slug": "minicpm-v4-6-1-3b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "262K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "30.5%",
      "HLE": "4.9%",
      "SciCode": "2.1%",
      "TAU2-bench": "87.7%",
      "TerminalBench-Hard": "0.0%",
      "IF-Bench": "26.7%",
      "LiveCodeBench Reasoning": "6.3%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Ring-2.6-1T",
    "company": "InclusionAI",
    "release_date": "2026-05-08",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "85.7%",
      "HLE": "18.3%",
      "SciCode": "42.4%",
      "TAU2-bench": "92.4%",
      "TerminalBench-Hard": "28.8%",
      "IF-Bench": "44.6%",
      "LiveCodeBench Reasoning": "64.3%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "InclusionAI Ring-2.6-1T — 262K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "ring-2-6-1t",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "MIT",
    "pricing": {
      "input_per_mtok": "$0.30",
      "output_per_mtok": "$2.50"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "85.7%",
      "HLE": "18.3%",
      "SciCode": "42.4%",
      "TAU2-bench": "92.4%",
      "TerminalBench-Hard": "28.8%",
      "IF-Bench": "44.6%",
      "LiveCodeBench Reasoning": "64.3%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GPT-5.5 Instant",
    "company": "OpenAI",
    "release_date": "2026-05-05",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "84.6%",
      "HLE": "20.3%",
      "SciCode": "50.3%",
      "TAU2-bench": "49.4%",
      "TerminalBench-Hard": "42.4%",
      "IF-Bench": "71.5%",
      "LiveCodeBench Reasoning": "55.7%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/index/gpt-5-5-instant",
    "description": "OpenAI GPT-5.5 Instant — 400K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gpt-5-5-instant-05-26",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "400K tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-08-31",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$5.00",
      "output_per_mtok": "$30.00",
      "cache_read_per_mtok": "$0.50"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "84.6%",
      "HLE": "20.3%",
      "SciCode": "50.3%",
      "TAU2-bench": "49.4%",
      "TerminalBench-Hard": "42.4%",
      "IF-Bench": "71.5%",
      "LiveCodeBench Reasoning": "55.7%"
    },
    "links": {
      "blog": "https://openai.com/index/gpt-5-5-instant"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "gemma-4-31B-it-qat-q4_0-gguf",
    "company": "google",
    "release_date": "2026-05-01",
    "model_release_at": {
      "value": "2026-05-01",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/google/gemma-4-31B-it-qat-q4_0-gguf",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-05-01",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/google/gemma-4-31B-it-qat-q4_0-gguf",
    "description": "",
    "category": "Major Release",
    "slug": "gemma-4-31b-it-qat-q4-0-gguf",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "gemma-4-26B-A4B-it-qat-q4_0-gguf",
    "company": "google",
    "release_date": "2026-05-01",
    "model_release_at": {
      "value": "2026-05-01",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/google/gemma-4-26B-A4B-it-qat-q4_0-gguf",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-05-01",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/google/gemma-4-26B-A4B-it-qat-q4_0-gguf",
    "description": "",
    "category": "Major Release",
    "slug": "gemma-4-26b-a4b-it-qat-q4-0-gguf",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Grok 4.3",
    "company": "xAI",
    "release_date": "2026-04-30",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "90.1%",
      "HLE": "35.0%",
      "SciCode": "47.3%",
      "TAU2-bench": "97.7%",
      "TerminalBench-Hard": "37.9%",
      "IF-Bench": "81.3%",
      "LiveCodeBench Reasoning": "64.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://docs.x.ai/developers/models/grok-4.3",
    "description": "xAI Grok 4.3 — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "grok-4-3",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$1.25",
      "output_per_mtok": "$2.50",
      "cache_read_per_mtok": "$0.20"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "90.1%",
      "HLE": "35.0%",
      "SciCode": "47.3%",
      "TAU2-bench": "97.7%",
      "TerminalBench-Hard": "37.9%",
      "IF-Bench": "81.3%",
      "LiveCodeBench Reasoning": "64.3%"
    },
    "links": {
      "blog": "https://docs.x.ai/developers/models/grok-4.3"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Granite 4.1 30B",
    "company": "IBM",
    "release_date": "2026-04-29",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "48.1%",
      "HLE": "4.2%",
      "SciCode": "25.8%",
      "TAU2-bench": "42.1%",
      "TerminalBench-Hard": "2.3%",
      "IF-Bench": "44.4%",
      "LiveCodeBench Reasoning": "18.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "IBM Granite 4.1 30B — 131K tokens context.",
    "category": "Major Release",
    "slug": "granite-4-1-30b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "131K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "48.1%",
      "HLE": "4.2%",
      "SciCode": "25.8%",
      "TAU2-bench": "42.1%",
      "TerminalBench-Hard": "2.3%",
      "IF-Bench": "44.4%",
      "LiveCodeBench Reasoning": "18.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Granite 4.1 3B",
    "company": "IBM",
    "release_date": "2026-04-29",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "31.4%",
      "HLE": "3.4%",
      "SciCode": "11.9%",
      "TAU2-bench": "19.6%",
      "TerminalBench-Hard": "2.3%",
      "IF-Bench": "33.7%",
      "LiveCodeBench Reasoning": "3.0%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "IBM Granite 4.1 3B — 131K tokens context.",
    "category": "Major Release",
    "slug": "granite-4-1-3b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "131K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "31.4%",
      "HLE": "3.4%",
      "SciCode": "11.9%",
      "TAU2-bench": "19.6%",
      "TerminalBench-Hard": "2.3%",
      "IF-Bench": "33.7%",
      "LiveCodeBench Reasoning": "3.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Granite 4.1 8B",
    "company": "IBM",
    "release_date": "2026-04-29",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "43.3%",
      "HLE": "3.8%",
      "SciCode": "21.8%",
      "TAU2-bench": "27.8%",
      "TerminalBench-Hard": "0.0%",
      "IF-Bench": "38.6%",
      "LiveCodeBench Reasoning": "12.0%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "IBM Granite 4.1 8B — 131K tokens context.",
    "category": "Major Release",
    "slug": "granite-4-1-8b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "131K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.05",
      "output_per_mtok": "$0.10"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "43.3%",
      "HLE": "3.8%",
      "SciCode": "21.8%",
      "TAU2-bench": "27.8%",
      "TerminalBench-Hard": "0.0%",
      "IF-Bench": "38.6%",
      "LiveCodeBench Reasoning": "12.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Mistral Medium 3.5",
    "company": "Mistral",
    "release_date": "2026-04-29",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "74.8%",
      "HLE": "12.8%",
      "SciCode": "39.6%",
      "TAU2-bench": "94.2%",
      "TerminalBench-Hard": "33.3%",
      "IF-Bench": "68.8%",
      "LiveCodeBench Reasoning": "61.0%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Mistral Mistral Medium 3.5 — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "mistral-medium-3-5",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Other",
    "pricing": {
      "input_per_mtok": "$1.50",
      "output_per_mtok": "$7.50"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "74.8%",
      "HLE": "12.8%",
      "SciCode": "39.6%",
      "TAU2-bench": "94.2%",
      "TerminalBench-Hard": "33.3%",
      "IF-Bench": "68.8%",
      "LiveCodeBench Reasoning": "61.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "DeepSeek V4 Flash",
    "company": "DeepSeek",
    "release_date": "2026-04-24",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "89.4%",
      "HLE": "32.1%",
      "SciCode": "44.9%",
      "TAU2-bench": "95.0%",
      "TerminalBench-Hard": "35.6%",
      "IF-Bench": "79.2%",
      "LiveCodeBench Reasoning": "63.0%"
    },
    "availability": "Open Source",
    "announcement_url": "https://api-docs.deepseek.com/news/news260424",
    "description": "DeepSeek DeepSeek V4 Flash — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "deepseek-v4-flash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "MIT",
    "pricing": {
      "input_per_mtok": "$0.14",
      "output_per_mtok": "$0.28",
      "cache_read_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "89.4%",
      "HLE": "32.1%",
      "SciCode": "44.9%",
      "TAU2-bench": "95.0%",
      "TerminalBench-Hard": "35.6%",
      "IF-Bench": "79.2%",
      "LiveCodeBench Reasoning": "63.0%"
    },
    "links": {
      "blog": "https://api-docs.deepseek.com/news/news260424"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "DeepSeek V4 Pro",
    "company": "DeepSeek",
    "release_date": "2026-04-24",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "88.8%",
      "HLE": "35.9%",
      "SciCode": "50.0%",
      "TAU2-bench": "96.2%",
      "TerminalBench-Hard": "46.2%",
      "IF-Bench": "76.5%",
      "LiveCodeBench Reasoning": "66.3%"
    },
    "availability": "Open Source",
    "announcement_url": "https://api-docs.deepseek.com/news/news260424",
    "description": "DeepSeek DeepSeek V4 Pro — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "deepseek-v4-pro",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "393K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "MIT",
    "pricing": {
      "input_per_mtok": "$1.74",
      "output_per_mtok": "$3.48",
      "cache_read_per_mtok": "$0.01"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "88.8%",
      "HLE": "35.9%",
      "SciCode": "50.0%",
      "TAU2-bench": "96.2%",
      "TerminalBench-Hard": "46.2%",
      "IF-Bench": "76.5%",
      "LiveCodeBench Reasoning": "66.3%"
    },
    "links": {
      "blog": "https://api-docs.deepseek.com/news/news260424"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Ling-2.6-1T",
    "company": "InclusionAI",
    "release_date": "2026-04-23",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "75.2%",
      "HLE": "8.2%",
      "SciCode": "37.0%",
      "TAU2-bench": "89.8%",
      "TerminalBench-Hard": "31.1%",
      "IF-Bench": "56.9%",
      "LiveCodeBench Reasoning": "34.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "InclusionAI Ling-2.6-1T — 262K tokens context.",
    "category": "Major Release",
    "slug": "ling-2-6-1t",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Mit",
    "pricing": {
      "input_per_mtok": "$0.30",
      "output_per_mtok": "$2.50"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "75.2%",
      "HLE": "8.2%",
      "SciCode": "37.0%",
      "TAU2-bench": "89.8%",
      "TerminalBench-Hard": "31.1%",
      "IF-Bench": "56.9%",
      "LiveCodeBench Reasoning": "34.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GPT-5.5",
    "company": "OpenAI",
    "release_date": "2026-04-23",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "93.5%",
      "HLE": "44.3%",
      "SciCode": "56.1%",
      "TAU2-bench": "93.9%",
      "TerminalBench-Hard": "60.6%",
      "IF-Bench": "75.9%",
      "LiveCodeBench Reasoning": "74.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/index/introducing-gpt-5-5/",
    "description": "OpenAI GPT-5.5 — 922K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gpt-5-5",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "922K tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$5.00",
      "output_per_mtok": "$30.00",
      "cache_read_per_mtok": "$0.50"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "93.5%",
      "HLE": "44.3%",
      "SciCode": "56.1%",
      "TAU2-bench": "93.9%",
      "TerminalBench-Hard": "60.6%",
      "IF-Bench": "75.9%",
      "LiveCodeBench Reasoning": "74.3%"
    },
    "links": {
      "blog": "https://openai.com/index/introducing-gpt-5-5/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Hy3-preview",
    "company": "Tencent",
    "release_date": "2026-04-23",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "86.7%",
      "HLE": "25.5%",
      "SciCode": "41.2%",
      "TAU2-bench": "92.7%",
      "TerminalBench-Hard": "34.1%",
      "IF-Bench": "63.1%",
      "LiveCodeBench Reasoning": "54.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Tencent Hy3-preview — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "hy3",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "256K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "TENCENT HY COMMUNITY LICENSE AGREEMENT",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00",
      "cache_read_per_mtok": "$0.10"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "86.7%",
      "HLE": "25.5%",
      "SciCode": "41.2%",
      "TAU2-bench": "92.7%",
      "TerminalBench-Hard": "34.1%",
      "IF-Bench": "63.1%",
      "LiveCodeBench Reasoning": "54.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "CADD-Base-7B",
    "company": "apple",
    "release_date": "2026-04-23",
    "model_release_at": {
      "value": "2026-04-23",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/apple/CADD-Base-7B",
      "retrieved_at": "2026-07-08T12:10:39Z",
      "verification": "lab-reported",
      "model_release_at": "2026-04-23",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/apple/CADD-Base-7B",
    "description": "",
    "category": "Major Release",
    "slug": "cadd-base-7b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Qwen3.6 27B",
    "company": "Alibaba",
    "release_date": "2026-04-22",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "84.2%",
      "HLE": "21.6%",
      "SciCode": "39.8%",
      "TAU2-bench": "94.2%",
      "TerminalBench-Hard": "34.8%",
      "IF-Bench": "67.6%",
      "LiveCodeBench Reasoning": "68.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Alibaba Qwen3.6 27B — 262K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "qwen3-6-27b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "81K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.60",
      "output_per_mtok": "$3.60"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "84.2%",
      "HLE": "21.6%",
      "SciCode": "39.8%",
      "TAU2-bench": "94.2%",
      "TerminalBench-Hard": "34.8%",
      "IF-Bench": "67.6%",
      "LiveCodeBench Reasoning": "68.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "MiMo-V2.5",
    "company": "Xiaomi",
    "release_date": "2026-04-22",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "84.9%",
      "HLE": "25.2%",
      "SciCode": "43.1%",
      "TAU2-bench": "90.6%",
      "TerminalBench-Hard": "41.7%",
      "IF-Bench": "67.1%",
      "LiveCodeBench Reasoning": "62.7%"
    },
    "availability": "Open Source",
    "announcement_url": "https://mimo.xiaomi.com/mimo-v2-5/",
    "description": "Xiaomi MiMo-V2.5 — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "mimo-v2-5-0424",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Mit",
    "pricing": {
      "input_per_mtok": "$0.36",
      "output_per_mtok": "$1.80",
      "cache_read_per_mtok": "$0.20"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "84.9%",
      "HLE": "25.2%",
      "SciCode": "43.1%",
      "TAU2-bench": "90.6%",
      "TerminalBench-Hard": "41.7%",
      "IF-Bench": "67.1%",
      "LiveCodeBench Reasoning": "62.7%"
    },
    "links": {
      "blog": "https://mimo.xiaomi.com/mimo-v2-5/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "MiMo-V2.5-Pro",
    "company": "Xiaomi",
    "release_date": "2026-04-22",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "86.6%",
      "HLE": "33.8%",
      "SciCode": "50.2%",
      "TAU2-bench": "94.2%",
      "TerminalBench-Hard": "43.2%",
      "IF-Bench": "79.9%",
      "LiveCodeBench Reasoning": "73.3%"
    },
    "availability": "Open Source",
    "announcement_url": "https://mimo.xiaomi.com/mimo-v2-5-pro/",
    "description": "Xiaomi MiMo-V2.5-Pro — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "mimo-v2-5-pro",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Mit",
    "pricing": {
      "input_per_mtok": "$1.00",
      "output_per_mtok": "$3.00",
      "cache_read_per_mtok": "$0.80"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "86.6%",
      "HLE": "33.8%",
      "SciCode": "50.2%",
      "TAU2-bench": "94.2%",
      "TerminalBench-Hard": "43.2%",
      "IF-Bench": "79.9%",
      "LiveCodeBench Reasoning": "73.3%"
    },
    "links": {
      "blog": "https://mimo.xiaomi.com/mimo-v2-5-pro/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Ling 2.6 Flash",
    "company": "InclusionAI",
    "release_date": "2026-04-21",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "59.3%",
      "HLE": "6.2%",
      "SciCode": "27.1%",
      "TAU2-bench": "86.0%",
      "TerminalBench-Hard": "21.2%",
      "IF-Bench": "57.4%",
      "LiveCodeBench Reasoning": "25.0%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "InclusionAI Ling 2.6 Flash — 262K tokens context.",
    "category": "Major Release",
    "slug": "ling-2-6-flash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Mit",
    "pricing": {
      "input_per_mtok": "$0.10",
      "output_per_mtok": "$0.30",
      "cache_read_per_mtok": "$0.02"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "59.3%",
      "HLE": "6.2%",
      "SciCode": "27.1%",
      "TAU2-bench": "86.0%",
      "TerminalBench-Hard": "21.2%",
      "IF-Bench": "57.4%",
      "LiveCodeBench Reasoning": "25.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Qwen3.6 Max Preview",
    "company": "Alibaba",
    "release_date": "2026-04-20",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "88.8%",
      "HLE": "28.9%",
      "SciCode": "46.9%",
      "TAU2-bench": "95.9%",
      "TerminalBench-Hard": "43.9%",
      "IF-Bench": "76.6%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "availability": "API Only",
    "announcement_url": "https://qwen.ai/blog?id=qwen3.6-max-preview",
    "description": "Alibaba Qwen3.6 Max Preview — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "qwen3-6-max",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$1.30",
      "output_per_mtok": "$7.80",
      "cache_read_per_mtok": "$0.13"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "88.8%",
      "HLE": "28.9%",
      "SciCode": "46.9%",
      "TAU2-bench": "95.9%",
      "TerminalBench-Hard": "43.9%",
      "IF-Bench": "76.6%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "links": {
      "blog": "https://qwen.ai/blog?id=qwen3.6-max-preview"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Kimi K2.6",
    "company": "Kimi",
    "release_date": "2026-04-20",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "91.1%",
      "HLE": "35.9%",
      "SciCode": "53.5%",
      "TAU2-bench": "95.9%",
      "TerminalBench-Hard": "43.9%",
      "IF-Bench": "76.0%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "availability": "Open Source",
    "announcement_url": "https://www.kimi.com/blog/kimi-k2-6",
    "description": "Kimi Kimi K2.6 — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "kimi-k2-6",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "256K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Modified MIT",
    "pricing": {
      "input_per_mtok": "$0.95",
      "output_per_mtok": "$4.00",
      "cache_read_per_mtok": "$0.16"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "91.1%",
      "HLE": "35.9%",
      "SciCode": "53.5%",
      "TAU2-bench": "95.9%",
      "TerminalBench-Hard": "43.9%",
      "IF-Bench": "76.0%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "links": {
      "blog": "https://www.kimi.com/blog/kimi-k2-6"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Qwen3.6 35B A3B",
    "company": "Alibaba",
    "release_date": "2026-04-16",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "84.1%",
      "HLE": "20.2%",
      "SciCode": "35.8%",
      "TAU2-bench": "95.3%",
      "TerminalBench-Hard": "34.8%",
      "IF-Bench": "64.4%",
      "LiveCodeBench Reasoning": "63.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Alibaba Qwen3.6 35B A3B — 262K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "qwen3-6-35b-a3b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.25",
      "output_per_mtok": "$1.49"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "84.1%",
      "HLE": "20.2%",
      "SciCode": "35.8%",
      "TAU2-bench": "95.3%",
      "TerminalBench-Hard": "34.8%",
      "IF-Bench": "64.4%",
      "LiveCodeBench Reasoning": "63.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude Opus 4.7",
    "company": "Anthropic",
    "release_date": "2026-04-16",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "91.4%",
      "HLE": "39.6%",
      "SciCode": "54.5%",
      "TAU2-bench": "88.6%",
      "TerminalBench-Hard": "51.5%",
      "IF-Bench": "58.6%",
      "LiveCodeBench Reasoning": "70.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-opus-4-7",
    "description": "Anthropic Claude Opus 4.7 — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "claude-opus-4-7",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2026-01-01",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$6.25",
      "output_per_mtok": "$25.00",
      "cache_read_per_mtok": "$0.50"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "91.4%",
      "HLE": "39.6%",
      "SciCode": "54.5%",
      "TAU2-bench": "88.6%",
      "TerminalBench-Hard": "51.5%",
      "IF-Bench": "58.6%",
      "LiveCodeBench Reasoning": "70.3%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-opus-4-7"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "JT-MINI",
    "company": "China Mobile",
    "release_date": "2026-04-15",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "67.6%",
      "HLE": "6.6%",
      "SciCode": "27.2%",
      "TAU2-bench": "93.0%",
      "TerminalBench-Hard": "18.2%",
      "IF-Bench": "36.7%",
      "LiveCodeBench Reasoning": "11.7%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "China Mobile JT-MINI — 128K tokens context.",
    "category": "Major Release",
    "slug": "jt-mini",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "67.6%",
      "HLE": "6.6%",
      "SciCode": "27.2%",
      "TAU2-bench": "93.0%",
      "TerminalBench-Hard": "18.2%",
      "IF-Bench": "36.7%",
      "LiveCodeBench Reasoning": "11.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "nemotron-labs-audio-visual-flamingo-hf",
    "company": "nvidia",
    "release_date": "2026-04-15",
    "model_release_at": {
      "value": "2026-04-15",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-04-15",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf",
    "description": "",
    "category": "Major Release",
    "slug": "nemotron-labs-audio-visual-flamingo-hf",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "skala-1.1",
    "company": "microsoft",
    "release_date": "2026-04-13",
    "model_release_at": {
      "value": "2026-04-13",
      "source": "HF Hub",
      "source_url": "https://huggingface.co/microsoft/skala-1.1",
      "retrieved_at": "2026-07-20T11:45:18Z",
      "verification": "lab-reported",
      "model_release_at": "2026-04-13",
      "benchmark_released_at": null
    },
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {},
    "availability": "API",
    "announcement_url": "https://huggingface.co/microsoft/skala-1.1",
    "description": "",
    "category": "Major Release",
    "slug": "skala-1-1",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [],
    "output_modalities": [],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {},
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "EXAONE 4.5 33B",
    "company": "LG AI Research",
    "release_date": "2026-04-09",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "79.4%",
      "HLE": "11.6%",
      "SciCode": "28.0%",
      "TAU2-bench": "78.1%",
      "TerminalBench-Hard": "20.5%",
      "IF-Bench": "58.0%",
      "LiveCodeBench Reasoning": "49.3%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "LG AI Research EXAONE 4.5 33B — 262K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "exaone-4-5-33b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "262K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "EXAONE AI Model License Agreement 1.2 - NC",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "79.4%",
      "HLE": "11.6%",
      "SciCode": "28.0%",
      "TAU2-bench": "78.1%",
      "TerminalBench-Hard": "20.5%",
      "IF-Bench": "58.0%",
      "LiveCodeBench Reasoning": "49.3%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Muse Spark",
    "company": "Meta",
    "release_date": "2026-04-08",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "88.4%",
      "HLE": "39.9%",
      "SciCode": "51.5%",
      "TAU2-bench": "91.5%",
      "TerminalBench-Hard": "45.5%",
      "IF-Bench": "75.9%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "availability": "API Only",
    "announcement_url": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
    "description": "Meta Muse Spark — 262K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "muse-spark",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "262K tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text",
      "image",
      "audio"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "88.4%",
      "HLE": "39.9%",
      "SciCode": "51.5%",
      "TAU2-bench": "91.5%",
      "TerminalBench-Hard": "45.5%",
      "IF-Bench": "75.9%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "links": {
      "blog": "https://ai.meta.com/blog/introducing-muse-spark-msl/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GLM-5.1",
    "company": "Z AI",
    "release_date": "2026-04-07",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "86.8%",
      "HLE": "28.0%",
      "SciCode": "43.8%",
      "TAU2-bench": "97.7%",
      "TerminalBench-Hard": "43.2%",
      "IF-Bench": "76.3%",
      "LiveCodeBench Reasoning": "62.3%"
    },
    "availability": "Open Source",
    "announcement_url": "https://huggingface.co/zai-org/GLM-5.1",
    "description": "Z AI GLM-5.1 — 200K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "glm-5-1",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Mit",
    "pricing": {
      "input_per_mtok": "$1.40",
      "output_per_mtok": "$4.40",
      "cache_read_per_mtok": "$0.26"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "86.8%",
      "HLE": "28.0%",
      "SciCode": "43.8%",
      "TAU2-bench": "97.7%",
      "TerminalBench-Hard": "43.2%",
      "IF-Bench": "76.3%",
      "LiveCodeBench Reasoning": "62.3%"
    },
    "links": {
      "blog": "https://huggingface.co/zai-org/GLM-5.1"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Grok 4.20 0309 v2",
    "company": "xAI",
    "release_date": "2026-04-07",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "91.1%",
      "HLE": "32.2%",
      "SciCode": "45.6%",
      "TAU2-bench": "93.0%",
      "TerminalBench-Hard": "37.9%",
      "IF-Bench": "81.2%",
      "LiveCodeBench Reasoning": "58.0%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "xAI Grok 4.20 0309 v2 — 2M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "grok-4-20",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "2M tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$2.00",
      "output_per_mtok": "$6.00",
      "cache_read_per_mtok": "$1.10"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "91.1%",
      "HLE": "32.2%",
      "SciCode": "45.6%",
      "TAU2-bench": "93.0%",
      "TerminalBench-Hard": "37.9%",
      "IF-Bench": "81.2%",
      "LiveCodeBench Reasoning": "58.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Solar Pro 3",
    "company": "Upstage",
    "release_date": "2026-04-06",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "72.4%",
      "HLE": "10.1%",
      "SciCode": "24.7%",
      "TAU2-bench": "86.3%",
      "TerminalBench-Hard": "7.6%",
      "IF-Bench": "71.2%",
      "LiveCodeBench Reasoning": "27.0%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "Upstage Solar Pro 3 — 128K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "solar-pro-3",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "72.4%",
      "HLE": "10.1%",
      "SciCode": "24.7%",
      "TAU2-bench": "86.3%",
      "TerminalBench-Hard": "7.6%",
      "IF-Bench": "71.2%",
      "LiveCodeBench Reasoning": "27.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemma 4 E4B",
    "company": "Google",
    "release_date": "2026-04-03",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "57.6%",
      "HLE": "3.7%",
      "SciCode": "24.4%",
      "TAU2-bench": "20.8%",
      "TerminalBench-Hard": "8.3%",
      "IF-Bench": "44.2%",
      "LiveCodeBench Reasoning": "30.7%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Google Gemma 4 E4B — 128K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gemma-4-e4b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.30",
      "output_per_mtok": "$1.25"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "57.6%",
      "HLE": "3.7%",
      "SciCode": "24.4%",
      "TAU2-bench": "20.8%",
      "TerminalBench-Hard": "8.3%",
      "IF-Bench": "44.2%",
      "LiveCodeBench Reasoning": "30.7%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Qwen3.6 Plus",
    "company": "Alibaba",
    "release_date": "2026-04-02",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "88.2%",
      "HLE": "25.7%",
      "SciCode": "40.7%",
      "TAU2-bench": "97.7%",
      "TerminalBench-Hard": "43.9%",
      "IF-Bench": "75.2%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "availability": "API Only",
    "announcement_url": "https://qwen.ai/blog?id=qwen3.6",
    "description": "Alibaba Qwen3.6 Plus — 1M tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "qwen3-6-plus",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.50",
      "output_per_mtok": "$3.00",
      "cache_read_per_mtok": "$0.05"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "88.2%",
      "HLE": "25.7%",
      "SciCode": "40.7%",
      "TAU2-bench": "97.7%",
      "TerminalBench-Hard": "43.9%",
      "IF-Bench": "75.2%",
      "LiveCodeBench Reasoning": "69.7%"
    },
    "links": {
      "blog": "https://qwen.ai/blog?id=qwen3.6"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemma 4 26B A4B",
    "company": "Google",
    "release_date": "2026-04-02",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "79.2%",
      "HLE": "18.3%",
      "SciCode": "40.0%",
      "TAU2-bench": "43.6%",
      "TerminalBench-Hard": "13.6%",
      "IF-Bench": "72.4%",
      "LiveCodeBench Reasoning": "55.7%"
    },
    "availability": "Open Source",
    "announcement_url": "https://aistudio.google.com/app/prompts/new_chat?model=gemma-4-26b-a4b-it",
    "description": "Google Gemma 4 26B A4B — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gemma-4-26b-a4b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.13",
      "output_per_mtok": "$0.40",
      "cache_read_per_mtok": "$0.10"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "79.2%",
      "HLE": "18.3%",
      "SciCode": "40.0%",
      "TAU2-bench": "43.6%",
      "TerminalBench-Hard": "13.6%",
      "IF-Bench": "72.4%",
      "LiveCodeBench Reasoning": "55.7%"
    },
    "links": {
      "blog": "https://aistudio.google.com/app/prompts/new_chat?model=gemma-4-26b-a4b-it"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemma 4 31B",
    "company": "Google",
    "release_date": "2026-04-02",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "85.7%",
      "HLE": "22.7%",
      "SciCode": "43.4%",
      "TAU2-bench": "59.9%",
      "TerminalBench-Hard": "36.4%",
      "IF-Bench": "75.6%",
      "LiveCodeBench Reasoning": "62.0%"
    },
    "availability": "Open Source",
    "announcement_url": "https://aistudio.google.com/app/prompts/new_chat?model=gemma-4-31b-it",
    "description": "Google Gemma 4 31B — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gemma-4-31b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "85.7%",
      "HLE": "22.7%",
      "SciCode": "43.4%",
      "TAU2-bench": "59.9%",
      "TerminalBench-Hard": "36.4%",
      "IF-Bench": "75.6%",
      "LiveCodeBench Reasoning": "62.0%"
    },
    "links": {
      "blog": "https://aistudio.google.com/app/prompts/new_chat?model=gemma-4-31b-it"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemma 4 E2B",
    "company": "Google",
    "release_date": "2026-04-02",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "43.3%",
      "HLE": "4.8%",
      "SciCode": "20.9%",
      "TAU2-bench": "20.8%",
      "TerminalBench-Hard": "3.0%",
      "IF-Bench": "38.0%",
      "LiveCodeBench Reasoning": "15.0%"
    },
    "availability": "Open Source",
    "announcement_url": "",
    "description": "Google Gemma 4 E2B — 128K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "gemma-4-e2b",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": "128K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "43.3%",
      "HLE": "4.8%",
      "SciCode": "20.9%",
      "TAU2-bench": "20.8%",
      "TerminalBench-Hard": "3.0%",
      "IF-Bench": "38.0%",
      "LiveCodeBench Reasoning": "15.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Step 3.5 Flash 2603",
    "company": "StepFun",
    "release_date": "2026-04-02",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "82.6%",
      "HLE": "22.6%",
      "SciCode": "38.5%",
      "TAU2-bench": "87.4%",
      "TerminalBench-Hard": "32.6%",
      "IF-Bench": "66.5%",
      "LiveCodeBench Reasoning": "54.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://huggingface.co/stepfun-ai/Step-3.5-Flash",
    "description": "StepFun Step 3.5 Flash 2603 — 256K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "step-3-5-flash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "256K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00",
      "cache_read_per_mtok": "$0.02"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "82.6%",
      "HLE": "22.6%",
      "SciCode": "38.5%",
      "TAU2-bench": "87.4%",
      "TerminalBench-Hard": "32.6%",
      "IF-Bench": "66.5%",
      "LiveCodeBench Reasoning": "54.3%"
    },
    "links": {
      "blog": "https://huggingface.co/stepfun-ai/Step-3.5-Flash"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Trinity Large Thinking",
    "company": "Arcee AI",
    "release_date": "2026-04-01",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "75.2%",
      "HLE": "14.7%",
      "SciCode": "36.1%",
      "TAU2-bench": "90.1%",
      "TerminalBench-Hard": "22.7%",
      "IF-Bench": "56.3%",
      "LiveCodeBench Reasoning": "33.0%"
    },
    "availability": "Open Source",
    "announcement_url": "https://www.arcee.ai/blog/trinity-large-thinking",
    "description": "Arcee AI Trinity Large Thinking — 512K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "trinity-large-thinking",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "512K tokens",
    "max_output_tokens": "80K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Apache 2.0",
    "pricing": {
      "input_per_mtok": "$0.23",
      "output_per_mtok": "$0.88",
      "cache_read_per_mtok": "$0.15"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "75.2%",
      "HLE": "14.7%",
      "SciCode": "36.1%",
      "TAU2-bench": "90.1%",
      "TerminalBench-Hard": "22.7%",
      "IF-Bench": "56.3%",
      "LiveCodeBench Reasoning": "33.0%"
    },
    "links": {
      "blog": "https://www.arcee.ai/blog/trinity-large-thinking"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GLM 5V Turbo",
    "company": "Z AI",
    "release_date": "2026-04-01",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "80.9%",
      "HLE": "15.8%",
      "SciCode": "43.5%",
      "TAU2-bench": "98.5%",
      "TerminalBench-Hard": "32.6%",
      "IF-Bench": "61.1%",
      "LiveCodeBench Reasoning": "61.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://docs.z.ai/guides/vlm/glm-5v-turbo",
    "description": "Z AI GLM 5V Turbo — 200K tokens context, reasoning model.",
    "category": "Major Release",
    "slug": "glm-5v-turbo",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "131K",
    "input_modalities": [
      "text",
      "image",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "80.9%",
      "HLE": "15.8%",
      "SciCode": "43.5%",
      "TAU2-bench": "98.5%",
      "TerminalBench-Hard": "32.6%",
      "IF-Bench": "61.1%",
      "LiveCodeBench Reasoning": "61.0%"
    },
    "links": {
      "blog": "https://docs.z.ai/guides/vlm/glm-5v-turbo"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Qwen3.5 Omni Flash",
    "company": "Alibaba",
    "release_date": "2026-03-30",
    "model_type": "LLM",
    "parameters": null,
    "key_features": [],
    "performance_metrics": {
      "GPQA Diamond": "74.2%",
      "HLE": "7.1%",
      "SciCode": "25.5%",
      "TAU2-bench": "84.5%",
      "TerminalBench-Hard": "8.3%",
      "IF-Bench": "38.0%",
      "LiveCodeBench Reasoning": "44.0%"
    },
    "availability": "API Only",
    "announcement_url": "",
    "description": "Alibaba Qwen3.5 Omni Flash — 256K tokens context.",
    "category": "Major Release",
    "slug": "qwen3-5-omni-flash",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.10",
      "output_per_mtok": "$0.80"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "GPQA Diamond": "74.2%",
      "HLE": "7.1%",
      "SciCode": "25.5%",
      "TAU2-bench": "84.5%",
      "TerminalBench-Hard": "8.3%",
      "IF-Bench": "38.0%",
      "LiveCodeBench Reasoning": "44.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemini 3.1 Pro",
    "company": "Google",
    "release_date": "2026-02-19",
    "model_type": "LLM",
    "parameters": "~1T MoE",
    "key_features": [
      "2x reasoning improvement",
      "ARC-AGI-2 score of 77.1%",
      "Enhanced multimodal understanding",
      "Deep Think mode"
    ],
    "performance_metrics": {
      "ARC-AGI-2": "77.1%",
      "MMLU": "93.8%",
      "MATH": "89.4%"
    },
    "availability": "API Only",
    "announcement_url": "https://blog.google/technology/ai/",
    "description": "Google's latest flagship model with a major 2x jump in reasoning capabilities",
    "category": "Major Release",
    "slug": "google-gemini-3-1-pro",
    "tagline": "Google's flagship reasoning model with a 2x jump on hard multi-step tasks.",
    "architecture": "Sparse Mixture-of-Experts (MoE)",
    "training_tokens": null,
    "context_window": "2M tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-12",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$2.50",
      "output_per_mtok": "$10.00",
      "cached_input_per_mtok": "$0.25"
    },
    "providers": [
      "Google AI Studio",
      "Vertex AI",
      "Gemini API"
    ],
    "rate_limits": null,
    "benchmarks": {
      "ARC-AGI-2": "77.1%",
      "MMLU-Pro": "93.8%",
      "MATH": "89.4%",
      "GPQA Diamond": "84.2%",
      "SWE-bench Verified": "72.3%",
      "LiveCodeBench": "78.9%"
    },
    "links": {
      "blog": "https://blog.google/technology/ai/",
      "docs": "https://ai.google.dev/gemini-api/docs/models",
      "model_card": "https://ai.google.dev/gemini-api/docs/models/gemini-3"
    },
    "predecessor_slug": "google-gemini-3-pro",
    "changelog": [
      "2x reasoning score on ARC-AGI-2 vs Gemini 3 Pro",
      "Context window expanded to 2M tokens",
      "Deep Think mode enabled by default on the Pro tier",
      "Lower latency on first-token despite larger context"
    ],
    "launch_coverage": [
      {
        "title": "Gemini 3.1 Pro Is A Powerhouse For Deep Work — Here Are 7 Prompts That...",
        "url": "https://www.tomsguide.com/ai/gemini-3-1-pro-is-a-powerhouse-for-deep-work-here-are-7-prompts-that-prove-it",
        "source": "tomsguide.com"
      }
    ]
  },
  {
    "name": "Claude Sonnet 4.6",
    "company": "Anthropic",
    "release_date": "2026-02-17",
    "model_type": "LLM",
    "parameters": "~500B",
    "key_features": [
      "Agent Teams: orchestrate 2-16 Claude instances",
      "Near-Opus performance at 1/5th cost",
      "80.8% SWE-bench Verified",
      "Fast mode research preview"
    ],
    "performance_metrics": {
      "SWE-bench": "80.8%",
      "MMLU": "92.1%",
      "HumanEval": "95.2%",
      "SWE-bench Verified": "80.8%",
      "GPQA Diamond": "79.9%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news",
    "description": "Anthropic's latest Sonnet with Agent Teams capability and near-Opus performance at a fraction of the cost",
    "category": "Major Release",
    "slug": "anthropic-claude-sonnet-4-6",
    "tagline": "Near-Opus quality at a fraction of the cost, with Agent Teams orchestration.",
    "architecture": "Dense Transformer (proprietary)",
    "training_tokens": null,
    "context_window": "500K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-10",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$3.00",
      "output_per_mtok": "$15.00",
      "cached_input_per_mtok": "$0.30",
      "cache_read_per_mtok": "$0.30"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "80.8%",
      "MMLU": "92.1%",
      "HumanEval": "95.2%",
      "GPQA Diamond": "79.7%",
      "AIME 2025": "88.5%",
      "TAU-bench": "71.2%",
      "HLE": "10.8%",
      "SciCode": "44.1%",
      "TAU2-bench": "78.9%",
      "TerminalBench-Hard": "42.4%",
      "IF-Bench": "42.4%",
      "LiveCodeBench Reasoning": "58.7%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news",
      "docs": "https://docs.anthropic.com/en/docs/about-claude/models",
      "system_card": "https://www.anthropic.com/news/claude-4-family"
    },
    "predecessor_slug": "anthropic-claude-sonnet-4",
    "changelog": [
      "Agent Teams: orchestrate 2–16 Claude instances in parallel",
      "+8.5pt on SWE-bench Verified vs Sonnet 4",
      "1/5 the cost of Opus 4.5 at ~95% of coding quality",
      "Fast mode research preview for lower-latency inference"
    ],
    "launch_coverage": [
      {
        "title": "I Ran 7 Real-World Prompts On Gemini 3 And Claude Sonnet 4.6 — The Results...",
        "url": "https://www.tomsguide.com/ai/i-ran-7-real-world-prompts-on-gemini-3-and-claude-sonnet-4-6-the-results-surprised-me",
        "source": "tomsguide.com"
      }
    ]
  },
  {
    "name": "DeepSeek V3.2",
    "company": "DeepSeek",
    "release_date": "2026-02-12",
    "model_type": "LLM",
    "parameters": "671B MoE",
    "key_features": [
      "1M+ token context window (10x expansion)",
      "Improved reasoning capabilities",
      "Open source release",
      "Cost-effective inference"
    ],
    "performance_metrics": {
      "MMLU": "90.1%",
      "HumanEval": "92.5%",
      "Context Window": "1M+ tokens",
      "MMLU-Pro": "83.7%",
      "GPQA Diamond": "75.1%"
    },
    "availability": "Open Source",
    "announcement_url": "https://github.com/deepseek-ai/DeepSeek-V3",
    "description": "Major update with 10x context window expansion to over 1 million tokens",
    "category": "Update",
    "slug": "deepseek-deepseek-v3-2",
    "tagline": "Open-weight MoE with a 1M+ token context window and strong coding.",
    "architecture": "Sparse MoE (37B active / 671B total)",
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "8K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-09",
    "license": "DeepSeek License (open weights, commercial OK)",
    "pricing": {
      "input_per_mtok": "$0.27",
      "output_per_mtok": "$1.10",
      "cached_input_per_mtok": "$0.07",
      "cache_read_per_mtok": "$0.50"
    },
    "providers": [
      "DeepSeek API",
      "Hugging Face",
      "Together AI",
      "Fireworks AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "90.1%",
      "HumanEval": "92.5%",
      "MATH": "85.6%",
      "GPQA": "68.4%",
      "LiveCodeBench": "86.2%",
      "MMLU-Pro": "86.2%",
      "GPQA Diamond": "84.0%",
      "HLE": "22.2%",
      "SciCode": "38.9%",
      "TAU2-bench": "90.6%",
      "TerminalBench-Hard": "35.6%",
      "IF-Bench": "60.7%",
      "LiveCodeBench Reasoning": "65.0%"
    },
    "links": {
      "repo": "https://github.com/deepseek-ai/DeepSeek-V3",
      "paper": "https://arxiv.org/abs/2412.19437",
      "model_card": "https://huggingface.co/deepseek-ai/DeepSeek-V3"
    },
    "predecessor_slug": "deepseek-deepseek-v3",
    "changelog": [
      "10x context window expansion (128K → 1M+ tokens)",
      "Sliding-window attention for long-context throughput",
      "Improved chain-of-thought reasoning",
      "Native FP8 inference support"
    ],
    "launch_coverage": []
  },
  {
    "name": "GLM-5",
    "company": "Zhipu AI",
    "release_date": "2026-02-11",
    "model_type": "LLM",
    "parameters": "744B",
    "key_features": [
      "First frontier model trained on Huawei Ascend chips (no NVIDIA)",
      "#1 HLE score (50.4%)",
      "1.2% hallucination rate via Slime RL",
      "136x cheaper than Claude Opus 4.5"
    ],
    "performance_metrics": {
      "HLE": "50.4%",
      "Hallucination Rate": "1.2%",
      "Cost": "$0.11/M tokens"
    },
    "availability": "API Only",
    "announcement_url": "https://www.zhipuai.cn/",
    "description": "First frontier AI model trained entirely without NVIDIA GPUs, using Huawei Ascend chips",
    "category": "Major Release",
    "slug": "zhipu-ai-glm-5",
    "tagline": "First frontier model trained entirely on Huawei Ascend silicon.",
    "architecture": "Dense Transformer (744B)",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-11",
    "license": "Proprietary (open weights for non-frontier sizes)",
    "pricing": {
      "input_per_mtok": "$0.11",
      "output_per_mtok": "$0.28"
    },
    "providers": [
      "Zhipu BigModel API"
    ],
    "rate_limits": null,
    "benchmarks": {
      "HLE": "50.4%",
      "MMLU": "88.7%",
      "Hallucination Rate": "1.2%",
      "C-Eval": "92.1%",
      "GSM8K": "94.8%"
    },
    "links": {
      "blog": "https://www.zhipuai.cn/",
      "paper": "https://arxiv.org/abs/2406.12793"
    },
    "predecessor_slug": null,
    "changelog": [
      "Trained entirely on Huawei Ascend 910B clusters (no NVIDIA)",
      "Slime RL fine-tuning drops hallucination rate to 1.2%",
      "136x cheaper than Claude Opus 4.5 at comparable quality"
    ],
    "launch_coverage": [
      {
        "title": "Glm 5 Is Being Tested On Openrouter",
        "url": "https://www.reddit.com/r/LocalLLaMA/comments/1qxqpdz/glm_5_is_being_tested_on_openrouter/",
        "source": "Reddit"
      }
    ]
  },
  {
    "name": "GPT-5.3 Codex",
    "company": "OpenAI",
    "release_date": "2026-02-05",
    "model_type": "Code",
    "parameters": "~200B",
    "key_features": [
      "Self-improving agentic coding",
      "25% faster than GPT-5.2-Codex",
      "1,000+ tokens/sec generation",
      "First OpenAI model flagged 'high' on cybersecurity framework"
    ],
    "performance_metrics": {
      "Terminal-Bench": "77.3%",
      "SWE-Bench Pro": "SOTA",
      "Speed": "1,000+ tok/s",
      "SWE-bench Verified": "82.4%",
      "HumanEval": "96.8%",
      "GPQA Diamond": "91.5%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/index/",
    "description": "OpenAI's specialized self-improving coding model with state-of-the-art software engineering performance",
    "category": "Major Release",
    "slug": "openai-gpt-5-3-codex",
    "tagline": "Coding-specialized variant of GPT-5.3, tuned for agentic IDE workflows.",
    "architecture": "MoE (coding-specialized fine-tune)",
    "training_tokens": null,
    "context_window": "400K tokens",
    "max_output_tokens": "100K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-11",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$1.25",
      "output_per_mtok": "$10.00",
      "cached_input_per_mtok": "$0.13",
      "cache_read_per_mtok": "$0.17"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI",
      "GitHub Copilot"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "82.4%",
      "HumanEval": "96.8%",
      "LiveCodeBench": "84.2%",
      "Aider Polyglot": "79.5%",
      "GPQA Diamond": "91.5%",
      "HLE": "39.9%",
      "SciCode": "53.2%",
      "TAU2-bench": "86.0%",
      "TerminalBench-Hard": "53.0%",
      "IF-Bench": "75.4%",
      "LiveCodeBench Reasoning": "74.0%"
    },
    "links": {
      "blog": "https://openai.com/blog/"
    },
    "predecessor_slug": "openai-gpt-5-2-codex",
    "changelog": [
      "+4pt on SWE-bench Verified vs GPT-5.2 Codex",
      "Native IDE tool-calling at reduced latency",
      "Extended max output to 100K for multi-file patches"
    ],
    "launch_coverage": [
      {
        "title": "Openai Just Launched Gpt-5.3-Codex: A Faster Agentic Coding Model Unifying Frontier Code Performance And Professional...",
        "url": "https://www.marktechpost.com/2026/02/05/openai-just-launched-gpt-5-3-codex-a-faster-agentic-coding-model-unifying-frontier-code-performance-and-professional-reasoning-into-one-system/",
        "source": "MarkTechPost"
      },
      {
        "title": "Gpt-5.3-Codex System Card",
        "url": "https://openai.com/index/gpt-5-3-codex-system-card",
        "source": "OpenAI"
      },
      {
        "title": "Introducing Gpt-5.3-Codex",
        "url": "https://openai.com/index/introducing-gpt-5-3-codex",
        "source": "OpenAI"
      },
      {
        "title": "They Actually Dropped Gpt-5.3 Codex The Minute Opus 4.6 Dropped Lol",
        "url": "https://www.reddit.com/r/OpenAI/comments/1qwsnp9/they_actually_dropped_gpt53_codex_the_minute_opus/",
        "source": "Reddit"
      },
      {
        "title": "Gpt-5.3 Codex Vs Opus 4.6: We Benchmarked Both On Our Production Rails Codebase — The...",
        "url": "https://www.reddit.com/r/ClaudeAI/comments/1qxr7vs/gpt53_codex_vs_opus_46_we_benchmarked_both_on_our/",
        "source": "Reddit"
      }
    ]
  },
  {
    "name": "Kimi K2",
    "company": "Moonshot AI",
    "release_date": "2026-01-20",
    "model_type": "LLM",
    "parameters": "1.04T MoE",
    "key_features": [
      "First open-weight model #1 on LMSYS Chatbot Arena",
      "1.04 trillion parameters",
      "K2.5 agent swarms with up to 100 sub-agents",
      "$0.15/M input tokens"
    ],
    "performance_metrics": {
      "LMSYS Arena": "#1",
      "Parameters": "1.04T",
      "Cost": "$0.15/M tokens"
    },
    "availability": "Open Source",
    "announcement_url": "https://www.moonshot.cn/",
    "description": "First open-weight model to rank #1 on LMSYS Chatbot Arena with over 1 trillion parameters",
    "category": "Major Release",
    "slug": "moonshot-ai-kimi-k2",
    "tagline": "Moonshot's open-weight frontier MoE with strong agentic benchmarks.",
    "architecture": "MoE (32B active / ~1T total)",
    "training_tokens": null,
    "context_window": "2M tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-10",
    "license": "Modified MIT (open weights)",
    "pricing": {
      "input_per_mtok": "$0.15",
      "output_per_mtok": "$2.50"
    },
    "providers": [
      "Moonshot API",
      "Hugging Face",
      "Together AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "91.3%",
      "SWE-bench Verified": "65.8%",
      "GPQA Diamond": "74.1%",
      "LiveCodeBench": "68.9%"
    },
    "links": {
      "repo": "https://github.com/MoonshotAI/Kimi-K2",
      "model_card": "https://huggingface.co/moonshotai/Kimi-K2"
    },
    "predecessor_slug": "moonshot-ai-moonshot-kimi",
    "changelog": [
      "2M token context window (20x vs first Kimi)",
      "Agentic tool-use tuning via MuonClip optimizer",
      "Open weights under modified MIT"
    ],
    "launch_coverage": [
      {
        "title": "Gpt-5.2 Xhigh, Glm-4.7, Kimi K2 Thinking, Deepseek V3.2 On Fresh Swe-Rebench (December 2025)",
        "url": "https://www.reddit.com/r/LocalLLaMA/comments/1qefa7q/gpt52_xhigh_glm47_kimi_k2_thinking_deepseek_v32/",
        "source": "Reddit"
      },
      {
        "title": "Kimi K2 Artificial Analysis Score",
        "url": "https://www.reddit.com/r/LocalLLaMA/comments/1qos25i/kimi_k2_artificial_analysis_score/",
        "source": "Reddit"
      }
    ]
  },
  {
    "name": "GPT-5.2 Codex",
    "company": "OpenAI",
    "release_date": "2025-12-18",
    "model_type": "Code",
    "parameters": "~200B",
    "key_features": [
      "Specialized for software engineering",
      "Enhanced agentic coding",
      "Multi-file refactoring",
      "Advanced debugging capabilities"
    ],
    "performance_metrics": {
      "SWE-Bench": "SOTA",
      "HumanEval": "96.1%",
      "Terminal-Bench": "72.8%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/index/",
    "description": "Specialized coding variant of GPT-5.2 focused on software engineering tasks",
    "category": "Update",
    "slug": "openai-gpt-5-2-codex",
    "tagline": "Prior-gen Codex variant of GPT-5.2 for agentic coding.",
    "architecture": "MoE (coding fine-tune)",
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-08",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$1.50",
      "output_per_mtok": "$12.00"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "78.2%",
      "HumanEval": "95.1%",
      "LiveCodeBench": "80.4%"
    },
    "links": {},
    "predecessor_slug": "openai-gpt-5-1",
    "changelog": [],
    "launch_coverage": [
      {
        "title": "Introducing Gpt-5.2-Codex",
        "url": "https://openai.com/index/introducing-gpt-5-2-codex",
        "source": "OpenAI"
      },
      {
        "title": "Addendum To Gpt-5.2 System Card: Gpt-5.2-Codex",
        "url": "https://openai.com/index/gpt-5-2-codex-system-card",
        "source": "OpenAI"
      }
    ]
  },
  {
    "name": "Mistral Large 3",
    "company": "Mistral",
    "release_date": "2025-12-15",
    "model_type": "LLM",
    "parameters": "~123B",
    "key_features": [
      "128K context window",
      "Improved multilingual capabilities",
      "Enhanced function calling",
      "Competitive with GPT-5 class models"
    ],
    "performance_metrics": {
      "MMLU": "88.2%",
      "HumanEval": "82.5%",
      "MATH": "72.1%",
      "MMLU-Pro": "80.7%",
      "GPQA Diamond": "68.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://mistral.ai/news/",
    "description": "Mistral's flagship model competing with GPT-5 class models at a fraction of the cost",
    "category": "Major Release",
    "slug": "mistral-mistral-large-3",
    "tagline": "Mistral's flagship proprietary model, tuned for European enterprise.",
    "architecture": "Dense Transformer",
    "training_tokens": null,
    "context_window": "256K tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-07",
    "license": "Mistral Commercial License",
    "pricing": {
      "input_per_mtok": "$2.00",
      "output_per_mtok": "$6.00"
    },
    "providers": [
      "Mistral La Plateforme",
      "Azure",
      "AWS Bedrock"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "89.4%",
      "HumanEval": "91.2%",
      "MATH": "82.1%",
      "MMMU": "76.8%",
      "MMLU-Pro": "80.7%",
      "GPQA Diamond": "68.0%",
      "LiveCodeBench": "46.5%",
      "HLE": "4.1%",
      "SciCode": "36.2%",
      "TAU2-bench": "24.6%",
      "TerminalBench-Hard": "15.9%",
      "IF-Bench": "36.2%",
      "LiveCodeBench Reasoning": "34.7%"
    },
    "links": {
      "blog": "https://mistral.ai/news/"
    },
    "predecessor_slug": "mistral-mistral-large",
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GPT-5.2",
    "company": "OpenAI",
    "release_date": "2025-12-11",
    "model_type": "LLM",
    "parameters": "~200B",
    "key_features": [
      "Enhanced reasoning capabilities",
      "Improved adaptive reasoning",
      "Better multimodal understanding",
      "Faster inference"
    ],
    "performance_metrics": {
      "MMLU": "92.8%",
      "MATH": "88.5%",
      "HumanEval": "95.8%",
      "MMLU-Pro": "87.4%",
      "SWE-bench Verified": "72.5%",
      "GPQA Diamond": "90.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/index/",
    "description": "Iterative improvement on GPT-5.1 with enhanced reasoning and faster performance",
    "category": "Update",
    "slug": "openai-gpt-5-2",
    "tagline": "Late-2025 GPT-5 refresh with improved reasoning and steerability.",
    "architecture": "MoE",
    "training_tokens": null,
    "context_window": "400K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "audio"
    ],
    "output_modalities": [
      "text",
      "audio"
    ],
    "knowledge_cutoff": "2025-08",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$2.00",
      "output_per_mtok": "$10.00",
      "cache_read_per_mtok": "$0.17"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI",
      "ChatGPT"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "87.4%",
      "GPQA Diamond": "90.3%",
      "SWE-bench Verified": "72.5%",
      "AIME 2025": "92.1%",
      "LiveCodeBench": "88.9%",
      "HLE": "35.4%",
      "SciCode": "52.1%",
      "TAU2-bench": "84.8%",
      "TerminalBench-Hard": "47.0%",
      "IF-Bench": "75.4%",
      "LiveCodeBench Reasoning": "72.7%"
    },
    "links": {},
    "predecessor_slug": "openai-gpt-5-1",
    "changelog": [],
    "launch_coverage": [
      {
        "title": "Openai’S Gpt-5.2 ‘Code Red’ Response To Google Is Coming Next Week",
        "url": "https://www.theverge.com/report/838857/openai-gpt-5-2-release-date-code-red-google-response",
        "source": "The Verge"
      },
      {
        "title": "Openai Introduces Gpt 5.2: A Long Context Workhorse For Agents, Coding And Knowledge Work",
        "url": "https://www.marktechpost.com/2025/12/11/openai-introduces-gpt-5-2-a-long-context-workhorse-for-agents-coding-and-knowledge-work/",
        "source": "MarkTechPost"
      },
      {
        "title": "Openai Calls Gpt-5.2 The Best Model Yet For Professionals",
        "url": "https://www.theverge.com/ai-artificial-intelligence/842529/openai-gpt-5-2-new-model-chatgpt",
        "source": "The Verge"
      },
      {
        "title": "Openai Launches Gpt-5.2 As It Navigates ‘Code Red’",
        "url": "https://www.wired.com/story/openai-gpt-launch-gemini-code-red/",
        "source": "Wired"
      },
      {
        "title": "Openai Fires Back At Google With Gpt-5.2 After ‘Code Red’ Memo | Techcrunch",
        "url": "https://techcrunch.com/2025/12/11/openai-fires-back-at-google-with-gpt-5-2-after-code-red-memo/",
        "source": "TechCrunch"
      }
    ]
  },
  {
    "name": "Claude Opus 4.5",
    "company": "Anthropic",
    "release_date": "2025-11-24",
    "model_type": "LLM",
    "parameters": "~500B",
    "key_features": [
      "First model to break 80.9% on SWE-Bench Verified",
      "67% price reduction vs previous Opus",
      "Extended reasoning capabilities",
      "Advanced coding performance"
    ],
    "performance_metrics": {
      "SWE-bench": "80.9%",
      "MMLU": "91.5%",
      "HumanEval": "95.0%",
      "MMLU-Pro": "88.9%",
      "SWE-bench Verified": "78.9%",
      "GPQA Diamond": "81.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news",
    "description": "Anthropic's most capable model with breakthrough coding performance and major price reduction",
    "category": "Major Release",
    "slug": "anthropic-claude-opus-4-5",
    "tagline": "Anthropic's top-tier reasoning model for complex research and agents.",
    "architecture": "Dense Transformer (proprietary)",
    "training_tokens": null,
    "context_window": "500K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-08",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$15.00",
      "output_per_mtok": "$75.00",
      "cached_input_per_mtok": "$1.50",
      "cache_read_per_mtok": "$0.50"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "78.9%",
      "MMLU": "92.8%",
      "GPQA Diamond": "86.6%",
      "AIME 2025": "90.5%",
      "MMLU-Pro": "89.5%",
      "LiveCodeBench": "87.1%",
      "HLE": "28.4%",
      "SciCode": "49.5%",
      "TAU2-bench": "89.5%",
      "TerminalBench-Hard": "47.0%",
      "IF-Bench": "58.0%",
      "LiveCodeBench Reasoning": "74.0%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news"
    },
    "predecessor_slug": "anthropic-claude-opus-4-1",
    "changelog": [],
    "launch_coverage": [
      {
        "title": "Epoch Ai Appears To Have Leaked Claude Opus 4.5'S Release Date Is Tomorrow",
        "url": "https://www.reddit.com/r/ClaudeAI/comments/1p4s2yo/epoch_ai_appears_to_have_leaked_claude_opus_45s/",
        "source": "Reddit"
      },
      {
        "title": "I Created A Free Retirement Planner With Claude Opus 4.5",
        "url": "https://www.reddit.com/r/ClaudeAI/comments/1q1co0q/i_created_a_free_retirement_planner_with_claude/",
        "source": "Reddit"
      }
    ]
  },
  {
    "name": "Gemini 3 Pro",
    "company": "Google",
    "release_date": "2025-11-18",
    "model_type": "Multimodal",
    "parameters": "~1T MoE",
    "key_features": [
      "1M token context window",
      "Deep Think reasoning mode",
      "Solved 5/6 IMO 2025 problems",
      "#1 on LMSYS Arena"
    ],
    "performance_metrics": {
      "ARC-AGI": "87.5%",
      "MMLU": "93.2%",
      "LMSYS Arena": "#1"
    },
    "availability": "API Only",
    "announcement_url": "https://blog.google/technology/ai/",
    "description": "Google's flagship model with Deep Think mode, ranked #1 on LMSYS Arena at launch",
    "category": "Major Release",
    "slug": "google-gemini-3-pro",
    "tagline": "First Gemini 3 tier release; strong multimodal + long-context.",
    "architecture": "Sparse MoE",
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-09",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$2.50",
      "output_per_mtok": "$10.00"
    },
    "providers": [
      "Google AI Studio",
      "Vertex AI",
      "Gemini API"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "89.4%",
      "MMMU": "82.1%",
      "GPQA Diamond": "78.5%",
      "SWE-bench Verified": "68.2%"
    },
    "links": {
      "blog": "https://blog.google/technology/ai/"
    },
    "predecessor_slug": "google-gemini-2-5-flash",
    "changelog": [],
    "launch_coverage": [
      {
        "title": "Google To Release Nano Banana Pro Powered By Gemini 3 Pro Next Week - Testingcatalog",
        "url": "https://www.testingcatalog.com/google-to-release-nano-banana-pro-powered-by-gemini-3-pro-next-week/",
        "source": "testingcatalog.com"
      },
      {
        "title": "Google Changes Gemini 3 Pro Free Access Limits Due To ‘High Demand’ - 9To5Google",
        "url": "http://9to5google.com/2025/11/27/gemini-3-pro-free-limits/",
        "source": "9to5google.com"
      },
      {
        "title": "Google Caps Gemini 3 Pro And Nano Banana Pro Usage As Servers Feel The Heat...",
        "url": "https://www.androidcentral.com/apps-software/insane-gemini-3-pro-demand-forces-google-to-cap-access",
        "source": "androidcentral.com"
      },
      {
        "title": "Google Just Dropped A New Agentic Benchmark: Gemini 3 Pro Beat Pokémon Crystal (Defeating Red)...",
        "url": "https://www.reddit.com/r/singularity/comments/1pngym8/google_just_dropped_a_new_agentic_benchmark/",
        "source": "Reddit"
      },
      {
        "title": "[D] How Did Gemini 3 Pro Manage To Get 38.3% On Humanity'S Last Exam?",
        "url": "https://www.reddit.com/r/MachineLearning/comments/1pgqbjd/d_how_did_gemini_3_pro_manage_to_get_383_on/",
        "source": "Reddit"
      }
    ]
  },
  {
    "name": "GPT-5.1",
    "company": "OpenAI",
    "release_date": "2025-11-12",
    "model_type": "LLM",
    "parameters": "~200B",
    "key_features": [
      "Adaptive reasoning modes",
      "Perfect 100% on AIME 2025",
      "87.5% on ARC-AGI",
      "Enhanced multimodal capabilities"
    ],
    "performance_metrics": {
      "ARC-AGI": "87.5%",
      "AIME 2025": "100%",
      "MMLU": "92.5%",
      "MMLU-Pro": "87.0%",
      "SWE-bench Verified": "70.1%",
      "GPQA Diamond": "87.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/index/",
    "description": "Major GPT-5 iteration with adaptive reasoning and perfect scores on math competitions",
    "category": "Major Release",
    "slug": "openai-gpt-5-1",
    "tagline": "Maintenance update to GPT-5 with steerability + latency improvements.",
    "architecture": "MoE",
    "training_tokens": null,
    "context_window": "400K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "audio"
    ],
    "output_modalities": [
      "text",
      "audio"
    ],
    "knowledge_cutoff": "2025-06",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$2.25",
      "output_per_mtok": "$11.00",
      "cache_read_per_mtok": "$0.12"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI",
      "ChatGPT"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "87.0%",
      "GPQA Diamond": "87.3%",
      "SWE-bench Verified": "70.1%",
      "LiveCodeBench": "86.8%",
      "HLE": "26.5%",
      "SciCode": "43.3%",
      "TAU2-bench": "81.9%",
      "TerminalBench-Hard": "45.5%",
      "IF-Bench": "72.9%",
      "LiveCodeBench Reasoning": "75.0%"
    },
    "links": {},
    "predecessor_slug": "openai-gpt-5",
    "changelog": [],
    "launch_coverage": [
      {
        "title": "Openai Walks A Tricky Tightrope With Gpt-5.1’S Eight New Personalities",
        "url": "https://arstechnica.com/ai/2025/11/openai-walks-a-tricky-tightrope-with-gpt-5-1s-eight-new-personalities/",
        "source": "Ars Technica"
      },
      {
        "title": "Openai Says The Brand-New Gpt-5.1 Is ‘Warmer’ And Has More ‘Personality’ Options",
        "url": "https://www.theverge.com/news/802653/openai-gpt-5-1-upgrade-personality-presets",
        "source": "The Verge"
      },
      {
        "title": "Openai Introduces Gpt-5.1: Combining Adaptive Reasoning, Account Level Personalization, And Updated Safety Metrics In The...",
        "url": "https://www.marktechpost.com/2025/11/12/openai-introduces-gpt-5-1-combining-adaptive-reasoning-account-level-personalization-and-updated-safety-metrics-in-the-gpt-5-stack/",
        "source": "MarkTechPost"
      },
      {
        "title": "Openai Debuts Gpt-5.1-Codex-Max, A Long-Horizon Agentic Coding Model With Compaction For Multi-Window Workflows",
        "url": "https://www.marktechpost.com/2025/11/19/openai-debuts-gpt-5-1-codex-max-a-long-horizon-agentic-coding-model-with-compaction-for-multi-window-workflows/",
        "source": "MarkTechPost"
      },
      {
        "title": "Gpt-5.1 Instant And Gpt-5.1 Thinking System Card Addendum",
        "url": "https://openai.com/index/gpt-5-system-card-addendum-gpt-5-1",
        "source": "OpenAI"
      }
    ]
  },
  {
    "name": "GPT-5",
    "company": "OpenAI",
    "release_date": "2025-08-15",
    "model_type": "LLM",
    "parameters": "~200B",
    "key_features": [
      "Adaptive reasoning (routes between quick and deep thinking)",
      "Improved math and coding",
      "Enhanced multimodal reasoning",
      "New safety architecture"
    ],
    "performance_metrics": {
      "MMLU": "91.0%",
      "HumanEval": "93.5%",
      "MATH": "85.0%",
      "MMLU-Pro": "87.1%",
      "SWE-bench Verified": "67.4%",
      "GPQA Diamond": "85.4%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/index/",
    "description": "OpenAI's next-generation flagship model with adaptive reasoning capabilities",
    "category": "Major Release",
    "slug": "openai-gpt-5",
    "tagline": "OpenAI's flagship unified reasoning + chat model replacing the GPT-4 line.",
    "architecture": "MoE with unified reasoning router",
    "training_tokens": null,
    "context_window": "400K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "audio"
    ],
    "output_modalities": [
      "text",
      "audio"
    ],
    "knowledge_cutoff": "2025-05",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$2.50",
      "output_per_mtok": "$12.00",
      "cache_read_per_mtok": "$0.12"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI",
      "ChatGPT"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "80.6%",
      "GPQA Diamond": "67.3%",
      "SWE-bench Verified": "67.4%",
      "MATH": "90.1%",
      "HumanEval": "95.1%",
      "LiveCodeBench": "55.8%",
      "MATH-500": "86.1%",
      "AIME 2025": "36.7%",
      "HLE": "5.4%",
      "SciCode": "38.8%",
      "TAU2-bench": "67.0%",
      "TerminalBench-Hard": "18.2%",
      "IF-Bench": "45.6%",
      "LiveCodeBench Reasoning": "25.0%"
    },
    "links": {
      "blog": "https://openai.com/blog/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": [
      {
        "title": "Openai Teases Gpt-5 Launch Event This Thursday",
        "url": "https://www.theverge.com/news/720114/openai-gpt-5-launch-event-tease",
        "source": "The Verge"
      },
      {
        "title": "Openai Launches Gpt-5 Free To All Chatgpt Users",
        "url": "https://arstechnica.com/ai/2025/08/openai-launches-gpt-5-free-to-all-chatgpt-users/",
        "source": "Ars Technica"
      },
      {
        "title": "Openai Just Released Gpt-5: The Smartest, Fastest, And Most Useful Openai Model",
        "url": "https://www.marktechpost.com/2025/08/07/openai-just-released-gpt-5-the-smartest-fastest-and-most-useful-openai-model/",
        "source": "MarkTechPost"
      },
      {
        "title": "Openai Launches Gpt-5, Nano, Mini And Pro — Not Agi, But Capable Of Generating ‘Software-On-Demand’",
        "url": "https://venturebeat.com/ai/openai-launches-gpt-5-not-agi-but-capable-of-generating-software-on-demand/",
        "source": "VentureBeat"
      },
      {
        "title": "The Gpt-5 Feature Openai Hasn’T Talked About (But It Changes Everything) 🧠",
        "url": "https://www.reddit.com/r/AI_Agents/comments/1mkfcy3/the_gpt5_feature_openai_hasnt_talked_about_but_it/",
        "source": "Reddit"
      }
    ]
  },
  {
    "name": "Claude Opus 4.1",
    "company": "Anthropic",
    "release_date": "2025-07-15",
    "model_type": "LLM",
    "parameters": "~500B",
    "key_features": [
      "Improved multi-file refactoring",
      "Enhanced agentic capabilities",
      "Better long-context performance",
      "Reduced hallucinations"
    ],
    "performance_metrics": {
      "SWE-bench": "75.2%",
      "MMLU": "90.8%",
      "HumanEval": "94.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news",
    "description": "Iterative improvement on Claude Opus 4 with enhanced multi-file refactoring",
    "category": "Update",
    "slug": "anthropic-claude-opus-4-1",
    "tagline": "Mid-2025 Opus refresh focused on agentic coding reliability.",
    "architecture": "Dense Transformer (proprietary)",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "32K",
    "input_modalities": [
      "text",
      "image",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-03",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$15.00",
      "output_per_mtok": "$75.00"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "74.5%",
      "MMLU": "91.2%",
      "GPQA Diamond": "79.1%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": [
      {
        "title": "Claude Opus 4.1 - Gets The Job Done No Matter What The Obstacle.",
        "url": "https://www.reddit.com/r/ClaudeAI/comments/1mjaxgt/claude_opus_41_gets_the_job_done_no_matter_what/",
        "source": "Reddit"
      },
      {
        "title": "Anyone Else Playing \"Bug Whack-A-Mole\" With Claude Opus 4.1? 😅",
        "url": "https://www.reddit.com/r/ClaudeAI/comments/1mtb2ka/anyone_else_playing_bug_whackamole_with_claude/",
        "source": "Reddit"
      }
    ]
  },
  {
    "name": "Gemini 2.5 Flash",
    "company": "Google",
    "release_date": "2025-06-20",
    "model_type": "Multimodal",
    "parameters": "~175B",
    "key_features": [
      "Enhanced image editing stabilization",
      "Faster inference",
      "Improved multimodal understanding",
      "Cost-effective deployment"
    ],
    "performance_metrics": {
      "MMLU": "87.5%",
      "Speed": "2x Gemini 2.0 Flash",
      "Image Quality": "High",
      "MMLU-Pro": "80.9%",
      "HumanEval": "95.1%",
      "GPQA Diamond": "68.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://blog.google/technology/ai/",
    "description": "Google's fast and cost-effective model with enhanced image capabilities",
    "category": "Update",
    "slug": "google-gemini-2-5-flash",
    "tagline": "Google's cost-optimized multimodal model with thinking mode.",
    "architecture": "Dense multimodal transformer",
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "65K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-01",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.30",
      "output_per_mtok": "$2.50",
      "cache_read_per_mtok": "$0.03"
    },
    "providers": [
      "Google AI Studio",
      "Vertex AI",
      "Gemini API"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "83.2%",
      "MMMU": "79.7%",
      "LiveCodeBench": "69.5%",
      "GPQA Diamond": "79.0%",
      "HumanEval": "96.2%",
      "MATH-500": "98.1%",
      "AIME 2025": "82.3%",
      "HLE": "11.1%",
      "SciCode": "39.4%",
      "TAU2-bench": "31.6%",
      "TerminalBench-Hard": "13.6%",
      "IF-Bench": "50.3%",
      "LiveCodeBench Reasoning": "61.7%"
    },
    "links": {
      "blog": "https://blog.google/technology/google-deepmind/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude Sonnet 4",
    "company": "Anthropic",
    "release_date": "2025-05-22",
    "model_type": "LLM",
    "parameters": "~500B",
    "key_features": [
      "Enhanced reasoning capabilities",
      "Improved safety measures",
      "Advanced multimodal understanding",
      "Extended context window"
    ],
    "performance_metrics": {
      "MMLU": "91.2%",
      "HumanEval": "94.5%",
      "MATH": "76.8%"
    },
    "availability": "API Only",
    "announcement_url": "https://docs.anthropic.com/en/release-notes/claude-apps",
    "description": "Latest generation Claude model with significant performance improvements",
    "category": "Major Release",
    "slug": "anthropic-claude-sonnet-4",
    "tagline": "Claude 4 mid-tier with strong coding and long-horizon agentic reliability.",
    "architecture": "Dense Transformer (proprietary)",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2025-03",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$3.00",
      "output_per_mtok": "$15.00"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "72.3%",
      "MMLU": "88.7%",
      "GPQA Diamond": "74.0%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-4",
      "system_card": "https://www-cdn.anthropic.com/claude-4-system-card.pdf"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude Sonnet 3.7",
    "company": "Anthropic",
    "release_date": "2025-02-24",
    "model_type": "LLM",
    "parameters": "~300B",
    "key_features": [
      "Improved reasoning",
      "Better code generation",
      "Enhanced safety",
      "Reduced hallucinations"
    ],
    "performance_metrics": {
      "MMLU": "89.5%",
      "HumanEval": "93.2%",
      "MATH": "74.1%"
    },
    "availability": "API Only",
    "announcement_url": "https://docs.anthropic.com/en/release-notes/claude-apps",
    "description": "Iterative improvement on Claude 3.5 with enhanced capabilities",
    "category": "Update",
    "slug": "anthropic-claude-sonnet-3-7",
    "tagline": "Extended-thinking update to Sonnet 3.5 with visible reasoning toggle.",
    "architecture": "Dense Transformer (proprietary)",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "64K",
    "input_modalities": [
      "text",
      "image",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2024-11",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$3.00",
      "output_per_mtok": "$15.00"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "62.3%",
      "MMLU": "86.1%",
      "GPQA Diamond": "68.3%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-3-7-sonnet"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "DeepSeek-V3",
    "company": "DeepSeek",
    "release_date": "2024-12-26",
    "model_type": "LLM",
    "parameters": "671B",
    "key_features": [
      "Mixture of Experts architecture",
      "Cost-effective training",
      "Open source release",
      "Strong reasoning capabilities"
    ],
    "performance_metrics": {
      "MMLU": "88.5%",
      "HumanEval": "90.2%",
      "MATH": "76.1%",
      "MMLU-Pro": "75.2%",
      "GPQA Diamond": "55.7%"
    },
    "availability": "Open Source",
    "announcement_url": "https://github.com/deepseek-ai/DeepSeek-V3",
    "description": "DeepSeek's most advanced open-source model with MoE architecture",
    "category": "Major Release",
    "slug": "deepseek-deepseek-v3",
    "tagline": "DeepSeek's breakthrough open-weight MoE rivaling GPT-4-class quality.",
    "architecture": "Sparse MoE (37B active / 671B total)",
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": "8K",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2024-07",
    "license": "DeepSeek License (open weights)",
    "pricing": {
      "input_per_mtok": "$0.27",
      "output_per_mtok": "$1.10"
    },
    "providers": [
      "DeepSeek API",
      "Hugging Face",
      "Together AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "88.5%",
      "HumanEval": "90.6%",
      "MATH": "61.6%",
      "MMLU-Pro": "75.2%",
      "GPQA Diamond": "55.7%",
      "LiveCodeBench": "35.9%",
      "MATH-500": "88.7%",
      "AIME 2025": "25.3%",
      "HLE": "3.6%",
      "SciCode": "35.4%",
      "TAU2-bench": "22.8%",
      "TerminalBench-Hard": "6.8%",
      "IF-Bench": "34.8%",
      "LiveCodeBench Reasoning": "29.0%"
    },
    "links": {
      "repo": "https://github.com/deepseek-ai/DeepSeek-V3",
      "paper": "https://arxiv.org/abs/2412.19437"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemini 2.0 Flash",
    "company": "Google",
    "release_date": "2024-12-11",
    "model_type": "Multimodal",
    "parameters": "~175B",
    "key_features": [
      "Native multimodal generation",
      "Real-time API",
      "Agentic capabilities",
      "Enhanced speed"
    ],
    "performance_metrics": {
      "MMLU": "85.8%",
      "HumanEval": "71.9%",
      "MATH": "58.8%",
      "MMLU-Pro": "77.9%",
      "GPQA Diamond": "62.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://blog.google/technology/google-deepmind/google-gemini-ai-update-december-2024/",
    "description": "Google's next-generation model with native multimodal capabilities",
    "category": "Major Release",
    "slug": "google-gemini-2-0-flash",
    "tagline": "First Gemini 2 model — fast, cheap, multimodal, with tool use native.",
    "architecture": "Dense multimodal transformer",
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "8K",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text",
      "image",
      "audio"
    ],
    "knowledge_cutoff": "2024-08",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$0.10",
      "output_per_mtok": "$0.40",
      "cache_read_per_mtok": "$0.03"
    },
    "providers": [
      "Google AI Studio",
      "Vertex AI",
      "Gemini API"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "78.2%",
      "MMMU": "70.7%",
      "LiveCodeBench": "21.0%",
      "GPQA Diamond": "63.6%",
      "HumanEval": "90.7%",
      "MATH-500": "91.1%",
      "AIME 2025": "30.0%",
      "HLE": "4.7%",
      "SciCode": "34.0%",
      "TAU2-bench": "29.5%",
      "TerminalBench-Hard": "3.8%",
      "IF-Bench": "40.2%",
      "LiveCodeBench Reasoning": "28.3%"
    },
    "links": {
      "blog": "https://blog.google/technology/google-deepmind/google-gemini-ai-update-december-2024/"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Grok-2",
    "company": "xAI",
    "release_date": "2024-08-13",
    "model_type": "LLM",
    "parameters": "~314B",
    "key_features": [
      "Real-time information access",
      "Multimodal understanding",
      "X platform integration",
      "Conversational AI"
    ],
    "performance_metrics": {
      "MMLU": "84.0%",
      "HumanEval": "74.1%",
      "MATH": "56.0%",
      "MMLU-Pro": "70.9%",
      "GPQA Diamond": "51.0%"
    },
    "availability": "Platform Exclusive",
    "announcement_url": "https://x.ai/blog/grok-2",
    "description": "xAI's flagship model with real-time web access and multimodal capabilities",
    "category": "Major Release",
    "slug": "xai-grok-2",
    "tagline": "Elon's second-gen Grok — real-time X/Twitter data access",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "Real-time (X feed)",
    "license": "Proprietary",
    "pricing": {
      "input": "$2/M",
      "output": "$10/M",
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [
      "xAI API",
      "x.com (Grok)"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "70.9%",
      "GPQA Diamond": "51.0%",
      "HumanEval": "86.3%",
      "LiveCodeBench": "26.7%",
      "MATH-500": "77.8%",
      "AIME 2025": "13.3%",
      "HLE": "3.8%",
      "SciCode": "28.5%"
    },
    "links": {
      "blog": "https://x.ai/blog/grok-2",
      "docs": "https://docs.x.ai"
    },
    "predecessor_slug": "xai-grok-1-5",
    "changelog": [
      "Vision input",
      "Real-time X data",
      "Improved reasoning"
    ],
    "launch_coverage": []
  },
  {
    "name": "Claude 3.5 Sonnet",
    "company": "Anthropic",
    "release_date": "2024-06-20",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "200K context window",
      "Improved coding capabilities",
      "Enhanced reasoning",
      "Vision capabilities"
    ],
    "performance_metrics": {
      "MMLU": "88.7%",
      "HumanEval": "92%",
      "MATH": "71.1%",
      "MMLU-Pro": "77.2%",
      "SWE-bench Verified": "49.0%",
      "GPQA Diamond": "59.9%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-3-5-sonnet",
    "description": "Anthropic's most intelligent model with significantly improved capabilities",
    "category": "Major Release",
    "slug": "anthropic-claude-3-5-sonnet",
    "tagline": "The mid-2024 Sonnet release that set the SOTA bar for coding and agents.",
    "architecture": "Dense Transformer (proprietary)",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "8K",
    "input_modalities": [
      "text",
      "image",
      "PDF"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2024-04",
    "license": "Proprietary",
    "pricing": {
      "input_per_mtok": "$3.00",
      "output_per_mtok": "$15.00",
      "cache_read_per_mtok": "$0.30"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "SWE-bench Verified": "49.0%",
      "MMLU": "88.7%",
      "HumanEval": "89.9%",
      "GPQA Diamond": "56.0%",
      "MMLU-Pro": "75.1%",
      "LiveCodeBench": "38.1%",
      "MATH-500": "69.5%",
      "AIME 2025": "9.7%",
      "HLE": "3.7%",
      "SciCode": "31.6%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-3-5-sonnet"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude 3 Opus",
    "company": "Anthropic",
    "release_date": "2024-03-04",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "200K context window",
      "Advanced reasoning",
      "Multimodal capabilities",
      "Constitutional AI training"
    ],
    "performance_metrics": {
      "MMLU": "86.8%",
      "HumanEval": "84.9%",
      "MATH": "60.1%",
      "MMLU-Pro": "69.6%",
      "GPQA Diamond": "48.9%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-3-family",
    "description": "Most capable model in the Claude 3 family with near-human performance on complex tasks",
    "category": "Major Release",
    "slug": "anthropic-claude-3-opus",
    "tagline": "Anthropic's most powerful pre-Claude 4 model — tops GPT-4 on reasoning",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "4096 tokens",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-08",
    "license": "Proprietary",
    "pricing": {
      "input": "$15/M",
      "output": "$75/M",
      "input_per_mtok": "$18.75",
      "output_per_mtok": "$75.00",
      "cache_read_per_mtok": "$1.50"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "86.8%",
      "HumanEval": "84.8%",
      "GSM8K": "95.0%",
      "MMLU-Pro": "69.6%",
      "GPQA Diamond": "48.9%",
      "LiveCodeBench": "27.9%",
      "MATH-500": "64.1%",
      "AIME 2025": "3.3%",
      "HLE": "3.1%",
      "SciCode": "23.3%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-3-family",
      "docs": "https://docs.anthropic.com"
    },
    "predecessor_slug": "anthropic-claude-2-1",
    "changelog": [
      "200K context",
      "Vision input",
      "+15% MMLU vs Claude 2",
      "Tool use"
    ],
    "launch_coverage": []
  },
  {
    "name": "Claude 3 Sonnet",
    "company": "Anthropic",
    "release_date": "2024-03-04",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "200K context window",
      "Balanced capability and speed",
      "Multimodal input",
      "Strong reasoning"
    ],
    "performance_metrics": {
      "MMLU": "79.0%",
      "HumanEval": "73.0%",
      "MATH": "40.5%",
      "MMLU-Pro": "57.9%",
      "GPQA Diamond": "40.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-3-family",
    "description": "Balanced model offering strong performance with faster response times",
    "category": "Major Release",
    "slug": "anthropic-claude-3-sonnet",
    "tagline": "Balanced Claude 3 variant — best price/performance in the family",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "4096 tokens",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-08",
    "license": "Proprietary",
    "pricing": {
      "input": "$3/M",
      "output": "$15/M",
      "input_per_mtok": "$3.00",
      "output_per_mtok": "$15.00"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "79.0%",
      "HumanEval": "71.3%",
      "MMLU-Pro": "57.9%",
      "GPQA Diamond": "40.0%",
      "LiveCodeBench": "17.5%",
      "MATH-500": "41.4%",
      "AIME 2025": "4.7%",
      "HLE": "3.8%",
      "SciCode": "22.9%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-3-family",
      "docs": "https://docs.anthropic.com"
    },
    "predecessor_slug": "anthropic-claude-2",
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude 3 Haiku",
    "company": "Anthropic",
    "release_date": "2024-03-04",
    "model_type": "LLM",
    "parameters": "~25B",
    "key_features": [
      "200K context window",
      "Fastest response times",
      "Multimodal input",
      "Cost-effective"
    ],
    "performance_metrics": {
      "MMLU": "75.2%",
      "HumanEval": "75.9%",
      "MATH": "38.9%",
      "GPQA Diamond": "37.4%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-3-family",
    "description": "Fastest and most compact model in the Claude 3 family",
    "category": "Major Release",
    "slug": "anthropic-claude-3-haiku",
    "tagline": "Fastest and cheapest Claude 3 — sub-second latency at $0.25/M",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": "4096 tokens",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-08",
    "license": "Proprietary",
    "pricing": {
      "input": "$0.25/M",
      "output": "$1.25/M",
      "input_per_mtok": "$0.25",
      "output_per_mtok": "$1.25"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock",
      "Google Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "75.2%",
      "HumanEval": "75.7%",
      "GPQA Diamond": "37.4%",
      "LiveCodeBench": "15.4%",
      "MATH-500": "39.4%",
      "AIME 2025": "1.0%",
      "HLE": "3.9%",
      "SciCode": "18.6%",
      "TAU2-bench": "21.1%",
      "TerminalBench-Hard": "0.8%",
      "IF-Bench": "36.1%",
      "LiveCodeBench Reasoning": "21.0%"
    },
    "links": {
      "blog": "https://www.anthropic.com/news/claude-3-family",
      "docs": "https://docs.anthropic.com"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Mistral Large",
    "company": "Mistral",
    "release_date": "2024-02-26",
    "model_type": "LLM",
    "parameters": "~70B",
    "key_features": [
      "32K context window",
      "Multilingual capabilities",
      "Function calling",
      "JSON mode"
    ],
    "performance_metrics": {
      "MMLU": "81.2%",
      "HumanEval": "45%",
      "HellaSwag": "89.2%",
      "MMLU-Pro": "51.5%",
      "GPQA Diamond": "35.1%"
    },
    "availability": "API Only",
    "announcement_url": "https://mistral.ai/news/mistral-large/",
    "description": "Top-tier reasoning model with strong multilingual capabilities",
    "category": "Major Release",
    "slug": "mistral-mistral-large",
    "tagline": null,
    "architecture": null,
    "training_tokens": null,
    "context_window": "32K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": null,
    "pricing": {
      "input_per_mtok": "$4.00",
      "output_per_mtok": "$12.00"
    },
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "51.5%",
      "GPQA Diamond": "35.1%",
      "HumanEval": "70.6%",
      "LiveCodeBench": "17.8%",
      "MATH-500": "52.7%",
      "AIME 2025": "0.0%",
      "HLE": "3.4%",
      "SciCode": "20.8%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemini 1.5 Pro",
    "company": "Google",
    "release_date": "2024-02-15",
    "model_type": "Multimodal",
    "parameters": "~175B",
    "key_features": [
      "1M token context window",
      "Multimodal understanding",
      "Video analysis",
      "Audio processing"
    ],
    "performance_metrics": {
      "MMLU": "85.9%",
      "HumanEval": "71.9%",
      "MATH": "58.5%",
      "MMLU-Pro": "75.0%",
      "GPQA Diamond": "58.9%"
    },
    "availability": "API Only",
    "announcement_url": "https://blog.google/technology/ai/google-gemini-next-generation-model-february-2024/",
    "description": "Google's next-generation model with breakthrough long context capabilities",
    "category": "Major Release",
    "slug": "google-gemini-1-5-pro",
    "tagline": "Google's first 1M-context model — multimodal needle-in-haystack champion",
    "architecture": "MoE Transformer",
    "training_tokens": null,
    "context_window": "1M tokens",
    "max_output_tokens": "8192 tokens",
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-11",
    "license": "Proprietary",
    "pricing": {
      "input (≤128K)": "$1.25/M",
      "input (>128K)": "$2.50/M",
      "output": "$5.00/M",
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [
      "Google AI Studio",
      "Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "81.9%",
      "HumanEval": "83.4%",
      "MATH": "58.5%",
      "MMLU-Pro": "65.7%",
      "GPQA Diamond": "37.1%",
      "LiveCodeBench": "24.4%",
      "MATH-500": "67.3%",
      "AIME 2025": "8.0%",
      "HLE": "3.9%",
      "SciCode": "27.4%"
    },
    "links": {
      "blog": "https://blog.google/technology/ai/google-gemini-next-generation-model-february-2024",
      "docs": "https://ai.google.dev"
    },
    "predecessor_slug": "google-gemini-pro",
    "changelog": [
      "1M token context",
      "Multi-hour video understanding",
      "MoE architecture"
    ],
    "launch_coverage": []
  },
  {
    "name": "text-embedding-3-large",
    "company": "OpenAI",
    "release_date": "2024-01-25",
    "model_type": "Embedding",
    "parameters": "~7B",
    "key_features": [
      "3072 embedding dimensions",
      "Improved retrieval performance",
      "Reduced hallucinations",
      "Multi-language support"
    ],
    "performance_metrics": {
      "MTEB Score": "64.6%",
      "Dimensions": "3072",
      "Languages": "100+"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/blog/new-embedding-models-and-api-updates",
    "description": "OpenAI's most powerful text embedding model",
    "category": "Major Release",
    "slug": "openai-text-embedding-3-large",
    "tagline": "OpenAI's best embedding model — 3× cheaper than ada-002 with better MTEB",
    "architecture": "Transformer encoder",
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "embeddings"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {
      "input": "$0.13/M"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MTEB avg": "64.6%"
    },
    "links": {
      "blog": "https://openai.com/blog/new-embedding-models-and-api-updates",
      "docs": "https://platform.openai.com/docs/guides/embeddings"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GPT-4 Turbo",
    "company": "OpenAI",
    "release_date": "2024-01-25",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "128K context window",
      "Improved instruction following",
      "Enhanced reasoning capabilities",
      "Reduced hallucinations"
    ],
    "performance_metrics": {
      "MMLU": "86.4%",
      "HumanEval": "67%",
      "HellaSwag": "95.3%",
      "MMLU-Pro": "69.4%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/blog/new-models-and-developer-products-announced-at-devday",
    "description": "Latest iteration of GPT-4 with improved performance and longer context window",
    "category": "Major Release",
    "slug": "openai-gpt-4-turbo",
    "tagline": "GPT-4 with 128K context and knowledge through April 2023 — 3× cheaper than GPT-4",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "128K tokens",
    "max_output_tokens": "4096 tokens",
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-04",
    "license": "Proprietary",
    "pricing": {
      "input": "$10/M",
      "output": "$30/M",
      "input_per_mtok": "$10.00",
      "output_per_mtok": "$30.00"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU-Pro": "69.4%",
      "HumanEval": "91.8%",
      "LiveCodeBench": "29.1%",
      "MATH-500": "73.7%",
      "AIME 2025": "15.0%",
      "HLE": "3.3%",
      "SciCode": "31.9%"
    },
    "links": {
      "blog": "https://openai.com/blog/new-models-and-developer-products-announced-at-devday",
      "docs": "https://platform.openai.com/docs"
    },
    "predecessor_slug": "openai-gpt-4",
    "changelog": [
      "128K context (8× increase)",
      "Updated knowledge cutoff",
      "3× cheaper than GPT-4"
    ],
    "launch_coverage": []
  },
  {
    "name": "Grok-1",
    "company": "xAI",
    "release_date": "2023-12-07",
    "model_type": "LLM",
    "parameters": "~314B",
    "key_features": [
      "Real-time information",
      "Conversational interface",
      "X platform integration",
      "Uncensored responses"
    ],
    "performance_metrics": {
      "MMLU": "73.0%",
      "HumanEval": "63.2%",
      "GSM8K": "62.9%"
    },
    "availability": "Platform Exclusive",
    "announcement_url": "https://x.ai/blog/grok",
    "description": "xAI's first major language model with real-time internet access",
    "category": "Major Release",
    "slug": "xai-grok-1",
    "tagline": "xAI's open-source release — 314B MoE, first frontier model fully open-sourced",
    "architecture": "MoE Transformer",
    "training_tokens": null,
    "context_window": "8K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-10-01",
    "license": "Apache 2.0",
    "pricing": {
      "self-hosted": "Free",
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [
      "Self-hosted (HuggingFace)"
    ],
    "rate_limits": null,
    "benchmarks": {},
    "links": {
      "repo": "https://github.com/xai-org/grok-1",
      "blog": "https://x.ai/blog/grok-os"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "AlphaCode 2",
    "company": "Google DeepMind",
    "release_date": "2023-12-06",
    "model_type": "Code",
    "parameters": "~340B",
    "key_features": [
      "Advanced code generation",
      "Competitive programming",
      "Multi-language support",
      "Problem decomposition"
    ],
    "performance_metrics": {
      "Codeforces Rating": "1747",
      "Problem Solving": "85th percentile",
      "Language Support": "10+ languages"
    },
    "availability": "Research Only",
    "announcement_url": "https://deepmind.google/discover/blog/competitive-programming-with-alphacode/",
    "description": "DeepMind's advanced code generation system for competitive programming",
    "category": "Research",
    "slug": "google-deepmind-alphacode-2",
    "tagline": "DeepMind's coding specialist — top 15% of competitive programmers",
    "architecture": "Transformer (Gemini-based)",
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [
      "text",
      "code"
    ],
    "output_modalities": [
      "code"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary (research)",
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "Codeforces percentile": "Top 15%"
    },
    "links": {
      "paper": "https://storage.googleapis.com/deepmind-media/AlphaCode2/AlphaCode2_Tech_Report.pdf"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Gemini Ultra",
    "company": "Google",
    "release_date": "2023-12-06",
    "model_type": "Multimodal",
    "parameters": "~540B",
    "key_features": [
      "Multimodal reasoning",
      "Text, image, audio, video understanding",
      "Advanced mathematical reasoning",
      "Code generation"
    ],
    "performance_metrics": {
      "MMLU": "90.0%",
      "HumanEval": "74.4%",
      "MATH": "53.2%"
    },
    "availability": "Limited Access",
    "announcement_url": "https://deepmind.google/technologies/gemini/",
    "description": "Google's most capable multimodal AI model",
    "category": "Major Release",
    "slug": "google-gemini-ultra",
    "tagline": "Google's first model to beat GPT-4 on MMLU — 90%+ with CoT",
    "architecture": "MoE Transformer",
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [
      "text",
      "image",
      "audio",
      "video"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-06",
    "license": "Proprietary",
    "pricing": {
      "Gemini Advanced": "$19.99/month"
    },
    "providers": [
      "Google One AI Premium",
      "Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "90.0%",
      "HumanEval": "74.4%",
      "MATH": "53.2%"
    },
    "links": {
      "blog": "https://blog.google/technology/ai/google-gemini-ai"
    },
    "predecessor_slug": "google-palm-2",
    "changelog": [
      "First model to exceed human expert on MMLU",
      "Native multimodal",
      "32K context"
    ],
    "launch_coverage": []
  },
  {
    "name": "Gemini Pro",
    "company": "Google",
    "release_date": "2023-12-06",
    "model_type": "Multimodal",
    "parameters": "~175B",
    "key_features": [
      "Multimodal capabilities",
      "32K context window",
      "Fast inference",
      "Scalable deployment"
    ],
    "performance_metrics": {
      "MMLU": "83.7%",
      "HumanEval": "67.7%",
      "MATH": "32.6%"
    },
    "availability": "API Only",
    "announcement_url": "https://deepmind.google/technologies/gemini/",
    "description": "Google's balanced model for wide range of tasks",
    "category": "Major Release",
    "slug": "google-gemini-pro",
    "tagline": "Google's workhorse Gemini model — free tier in Google AI Studio",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "32K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text",
      "image"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-06",
    "license": "Proprietary",
    "pricing": {
      "input": "Free (AI Studio)",
      "Vertex AI": "$0.50/M"
    },
    "providers": [
      "Google AI Studio",
      "Vertex AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "79.1%",
      "HumanEval": "67.7%"
    },
    "links": {
      "blog": "https://blog.google/technology/ai/google-gemini-ai",
      "docs": "https://ai.google.dev"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude 2.1",
    "company": "Anthropic",
    "release_date": "2023-11-21",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "200K context window",
      "Reduced hallucination rates",
      "Enhanced accuracy",
      "Tool use capabilities"
    ],
    "performance_metrics": {
      "MMLU": "88.0%",
      "HumanEval": "71.2%",
      "MATH": "71.1%",
      "MMLU-Pro": "49.5%",
      "GPQA Diamond": "31.9%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-2-1",
    "description": "Significant improvements in accuracy and honesty over Claude 2",
    "category": "Update",
    "slug": "anthropic-claude-2-1",
    "tagline": "Claude 2 update — 200K context and reduced hallucinations",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "200K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-01",
    "license": "Proprietary",
    "pricing": {
      "input": "$8/M",
      "output": "$24/M",
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "73.1%",
      "HumanEval": "15.9%",
      "MMLU-Pro": "49.5%",
      "GPQA Diamond": "31.9%",
      "LiveCodeBench": "19.5%",
      "MATH-500": "37.4%",
      "AIME 2025": "3.3%",
      "HLE": "4.2%",
      "SciCode": "18.4%"
    },
    "links": {},
    "predecessor_slug": "anthropic-claude-2",
    "changelog": [
      "200K context (2× Claude 2)",
      "50% fewer hallucinations",
      "Tool use beta"
    ],
    "launch_coverage": []
  },
  {
    "name": "Whisper v3",
    "company": "OpenAI",
    "release_date": "2023-11-06",
    "model_type": "Audio",
    "parameters": "~1.55B",
    "key_features": [
      "Multilingual speech recognition",
      "99 language support",
      "Robust noise handling",
      "Real-time transcription"
    ],
    "performance_metrics": {
      "WER English": "5.1%",
      "Language Coverage": "99 languages",
      "Real-time Factor": "0.8x"
    },
    "availability": "Open Source",
    "announcement_url": "https://github.com/openai/whisper",
    "description": "OpenAI's multilingual speech recognition system",
    "category": "Major Release",
    "slug": "openai-whisper-v3",
    "tagline": "State-of-the-art open speech recognition — 99 languages, open weights",
    "architecture": "Transformer encoder-decoder",
    "training_tokens": null,
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [
      "audio"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "MIT",
    "pricing": {
      "OpenAI API": "$0.006/minute",
      "self-hosted": "Free"
    },
    "providers": [
      "OpenAI API",
      "Self-hosted (HuggingFace)",
      "Groq"
    ],
    "rate_limits": null,
    "benchmarks": {
      "WER (English)": "~2.7%"
    },
    "links": {
      "repo": "https://github.com/openai/whisper",
      "blog": "https://openai.com/research/whisper"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Code Llama 34B",
    "company": "Meta",
    "release_date": "2023-08-24",
    "model_type": "Code",
    "parameters": "34B",
    "key_features": [
      "Code generation",
      "Code completion",
      "Multiple programming languages",
      "Large context window"
    ],
    "performance_metrics": {
      "HumanEval": "48.4%",
      "MBPP": "55.0%",
      "MultiPL-E": "45.9%"
    },
    "availability": "Open Source",
    "announcement_url": "https://ai.meta.com/blog/code-llama-large-language-model-coding/",
    "description": "Specialized model for code generation built on Llama 2",
    "category": "Major Release",
    "slug": "meta-code-llama-34b",
    "tagline": "Meta's code-specialized open model — top open-source coding at launch",
    "architecture": "Transformer (Llama 2 fine-tune)",
    "training_tokens": null,
    "context_window": "100K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text",
      "code"
    ],
    "output_modalities": [
      "code",
      "text"
    ],
    "knowledge_cutoff": "2023-01",
    "license": "Llama 2 Community License",
    "pricing": {
      "self-hosted": "Free"
    },
    "providers": [
      "Self-hosted",
      "Together AI",
      "Fireworks AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "HumanEval": "48.8%"
    },
    "links": {
      "repo": "https://github.com/facebookresearch/codellama",
      "paper": "https://arxiv.org/abs/2308.12950"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Llama 2 70B",
    "company": "Meta",
    "release_date": "2023-07-18",
    "model_type": "LLM",
    "parameters": "70B",
    "key_features": [
      "Open source",
      "Commercial license",
      "Improved safety",
      "Enhanced performance"
    ],
    "performance_metrics": {
      "MMLU": "68.9%",
      "HumanEval": "29.9%",
      "MATH": "13.5%"
    },
    "availability": "Open Source",
    "announcement_url": "https://ai.meta.com/blog/llama-2/",
    "description": "Meta's open-source large language model with commercial license",
    "category": "Major Release",
    "slug": "meta-llama-2-70b",
    "tagline": "Meta's open-weight landmark — 70B that matched GPT-3.5 and ignited open AI",
    "architecture": "Transformer",
    "training_tokens": "2T tokens",
    "context_window": "4K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-01",
    "license": "Llama 2 Community License",
    "pricing": {
      "self-hosted": "Free",
      "Together AI": "$0.90/M"
    },
    "providers": [
      "Self-hosted",
      "Together AI",
      "AWS Bedrock",
      "Azure AI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "68.9%",
      "HumanEval": "29.9%"
    },
    "links": {
      "repo": "https://github.com/facebookresearch/llama",
      "paper": "https://arxiv.org/abs/2307.09288"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Claude 2",
    "company": "Anthropic",
    "release_date": "2023-07-11",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "100K context window",
      "Improved safety",
      "Enhanced reasoning",
      "Better code generation"
    ],
    "performance_metrics": {
      "MMLU": "78.5%",
      "HumanEval": "71.2%",
      "MATH": "88.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/claude-2",
    "description": "Significant improvement over Claude 1 with enhanced capabilities",
    "category": "Major Release",
    "slug": "anthropic-claude-2",
    "tagline": "Claude's first major leap — 100K context and better at instructions",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "100K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-01",
    "license": "Proprietary",
    "pricing": {
      "input": "$8/M",
      "output": "$24/M"
    },
    "providers": [
      "Anthropic API",
      "AWS Bedrock"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "78.5%",
      "HumanEval": "71.2%"
    },
    "links": {},
    "predecessor_slug": "anthropic-claude-1-3",
    "changelog": [
      "100K context (10× Claude 1)",
      "Improved reasoning",
      "Reduced refusals"
    ],
    "launch_coverage": []
  },
  {
    "name": "PaLM 2",
    "company": "Google",
    "release_date": "2023-05-10",
    "model_type": "LLM",
    "parameters": "~340B",
    "key_features": [
      "Multilingual capabilities",
      "Reasoning improvements",
      "Coding abilities",
      "Multiple model sizes"
    ],
    "performance_metrics": {
      "MMLU": "86.4%",
      "HumanEval": "77.2%",
      "MATH": "34.3%"
    },
    "availability": "API Only",
    "announcement_url": "https://blog.google/technology/ai/google-palm-2-ai-large-language-model/",
    "description": "Google's improved large language model powering Bard and other services",
    "category": "Major Release",
    "slug": "google-palm-2",
    "tagline": "Google's multilingual flagship — powers Bard 2023, 100+ languages",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "8K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2023-02",
    "license": "Proprietary",
    "pricing": {
      "PaLM API (Bison)": "$0.50/M",
      "input_per_mtok": "$0.00",
      "output_per_mtok": "$0.00"
    },
    "providers": [
      "Google Cloud Vertex AI",
      "Google AI Studio"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "78.3%",
      "MATH": "34.3%"
    },
    "links": {
      "paper": "https://arxiv.org/abs/2305.10403",
      "blog": "https://blog.google/technology/ai/google-palm-2-ai-large-language-model"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GPT-4",
    "company": "OpenAI",
    "release_date": "2023-03-14",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "8K context window",
      "Multimodal capabilities",
      "Enhanced reasoning",
      "Improved factual accuracy"
    ],
    "performance_metrics": {
      "MMLU": "86.4%",
      "HumanEval": "67.0%",
      "MATH": "42.5%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/research/gpt-4",
    "description": "OpenAI's most advanced system producing safer and more useful responses",
    "category": "Major Release",
    "slug": "openai-gpt-4",
    "tagline": "The model that changed everything — GPT-4 set the standard for capable AI",
    "architecture": "Transformer (reported MoE)",
    "training_tokens": null,
    "context_window": "8K tokens (32K with gpt-4-32k)",
    "max_output_tokens": "4096 tokens",
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2021-09",
    "license": "Proprietary",
    "pricing": {
      "input": "$30/M",
      "output": "$60/M",
      "input_per_mtok": "$30.00",
      "output_per_mtok": "$60.00"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "86.4%",
      "HumanEval": "67.0%",
      "MATH": "52.9%",
      "Bar exam": "~90th percentile"
    },
    "links": {
      "technical_report": "https://arxiv.org/abs/2303.08774",
      "blog": "https://openai.com/gpt-4"
    },
    "predecessor_slug": "openai-chatgpt-gpt-3-5-turbo",
    "changelog": [
      "Passed bar exam (top 10%)",
      "Vision input (GPT-4V)",
      "Multimodal"
    ],
    "launch_coverage": []
  },
  {
    "name": "Claude 1.3",
    "company": "Anthropic",
    "release_date": "2023-03-14",
    "model_type": "LLM",
    "parameters": "~52B",
    "key_features": [
      "Constitutional AI",
      "Helpful and harmless",
      "Long conversations",
      "Improved reasoning"
    ],
    "performance_metrics": {
      "MMLU": "77.0%",
      "HumanEval": "56.0%",
      "MATH": "36.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://www.anthropic.com/news/introducing-claude",
    "description": "Anthropic's AI assistant built using Constitutional AI methods",
    "category": "Major Release",
    "slug": "anthropic-claude-1-3",
    "tagline": "Anthropic's first public model — 100K context ahead of its time",
    "architecture": "Transformer",
    "training_tokens": null,
    "context_window": "100K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2022-12",
    "license": "Proprietary",
    "pricing": {
      "input": "$8/M",
      "output": "$24/M"
    },
    "providers": [
      "Anthropic API"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "75.0%"
    },
    "links": {},
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "ChatGPT (GPT-3.5 Turbo)",
    "company": "OpenAI",
    "release_date": "2022-11-30",
    "model_type": "LLM",
    "parameters": "~175B",
    "key_features": [
      "Conversational interface",
      "Fine-tuned for chat",
      "RLHF training",
      "Fast response times"
    ],
    "performance_metrics": {
      "MMLU": "70.0%",
      "HumanEval": "48.1%",
      "MATH": "34.1%"
    },
    "availability": "Free + Paid Tiers",
    "announcement_url": "https://openai.com/blog/chatgpt",
    "description": "Conversational AI that sparked mainstream adoption of large language models",
    "category": "Major Release",
    "slug": "openai-chatgpt-gpt-3-5-turbo",
    "tagline": "The product that launched the AI era — 100M users in 2 months",
    "architecture": "Transformer (RLHF fine-tune of GPT-3.5)",
    "training_tokens": null,
    "context_window": "16K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2021-09",
    "license": "Proprietary",
    "pricing": {
      "input": "$0.50/M",
      "output": "$1.50/M"
    },
    "providers": [
      "OpenAI API",
      "Azure OpenAI"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "70.0%",
      "HumanEval": "48.1%"
    },
    "links": {
      "blog": "https://openai.com/blog/chatgpt",
      "docs": "https://platform.openai.com/docs"
    },
    "predecessor_slug": "openai-instructgpt",
    "changelog": [
      "Conversational interface",
      "RLHF alignment",
      "Faster and cheaper than GPT-4"
    ],
    "launch_coverage": []
  },
  {
    "name": "PaLM",
    "company": "Google",
    "release_date": "2022-04-04",
    "model_type": "LLM",
    "parameters": "540B",
    "key_features": [
      "Large parameter count",
      "Few-shot learning",
      "Reasoning capabilities",
      "Code generation"
    ],
    "performance_metrics": {
      "MMLU": "69.3%",
      "HumanEval": "26.2%",
      "MATH": "8.8%"
    },
    "availability": "Research Only",
    "announcement_url": "https://ai.googleblog.com/2022/04/pathways-language-model-palm-scaling-to.html",
    "description": "Google's 540-billion parameter language model demonstrating breakthrough capabilities",
    "category": "Research",
    "slug": "google-palm",
    "tagline": "Google's 540B pathways model — first to demonstrate chain-of-thought at scale",
    "architecture": "Pathways Transformer",
    "training_tokens": "780B tokens",
    "context_window": null,
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary (research)",
    "pricing": {},
    "providers": [],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "69.3%",
      "BIG-bench": "58.1%"
    },
    "links": {
      "paper": "https://arxiv.org/abs/2204.02311",
      "blog": "https://ai.googleblog.com/2022/04/pathways-language-model-palm-scaling-to.html"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "Codex",
    "company": "OpenAI",
    "release_date": "2021-08-10",
    "model_type": "Code",
    "parameters": "~12B",
    "key_features": [
      "Code generation",
      "Natural language to code",
      "Multiple programming languages",
      "GitHub Copilot integration"
    ],
    "performance_metrics": {
      "HumanEval": "28.8%",
      "MBPP": "59.6%",
      "APPS": "25.0%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/blog/openai-codex",
    "description": "AI system that translates natural language to code",
    "category": "Major Release",
    "slug": "openai-codex",
    "tagline": "GPT-3 trained on code — the engine behind GitHub Copilot v1",
    "architecture": "Transformer (GPT-3 fine-tune)",
    "training_tokens": null,
    "context_window": "4K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text",
      "code"
    ],
    "output_modalities": [
      "code"
    ],
    "knowledge_cutoff": null,
    "license": "Proprietary",
    "pricing": {},
    "providers": [
      "OpenAI API (deprecated)",
      "GitHub Copilot"
    ],
    "rate_limits": null,
    "benchmarks": {
      "HumanEval": "28.8%"
    },
    "links": {
      "paper": "https://arxiv.org/abs/2107.03374",
      "blog": "https://openai.com/blog/openai-codex"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  },
  {
    "name": "GPT-3",
    "company": "OpenAI",
    "release_date": "2020-06-11",
    "model_type": "LLM",
    "parameters": "175B",
    "key_features": [
      "175 billion parameters",
      "Few-shot learning",
      "Text generation",
      "Multiple capabilities"
    ],
    "performance_metrics": {
      "MMLU": "43.9%",
      "HumanEval": "0.0%",
      "MATH": "5.2%"
    },
    "availability": "API Only",
    "announcement_url": "https://openai.com/blog/gpt-3-apps",
    "description": "Breakthrough large language model that demonstrated emergent capabilities",
    "category": "Major Release",
    "slug": "openai-gpt-3",
    "tagline": "The model that showed scaling works — 175B parameters, few-shot learning pioneer",
    "architecture": "Transformer",
    "training_tokens": "300B tokens",
    "context_window": "2K tokens",
    "max_output_tokens": null,
    "input_modalities": [
      "text"
    ],
    "output_modalities": [
      "text"
    ],
    "knowledge_cutoff": "2019-10",
    "license": "Proprietary (API)",
    "pricing": {
      "Davinci": "$0.02/1K tokens"
    },
    "providers": [
      "OpenAI API"
    ],
    "rate_limits": null,
    "benchmarks": {
      "MMLU": "43.9%"
    },
    "links": {
      "paper": "https://arxiv.org/abs/2005.14165",
      "blog": "https://openai.com/blog/openai-api"
    },
    "predecessor_slug": null,
    "changelog": [],
    "launch_coverage": []
  }
]
