{
  "schemaVersion": "1.0",
  "name": "BenchLM curated comparisons",
  "description": "Curated and high-value model comparisons. BenchLM supports more pairwise comparison pages than this export includes.",
  "canonicalUrl": "https://benchlm.ai/data/comparisons.json",
  "generatedAt": "2026-09-02T00:50:21.010Z",
  "sourceLastUpdated": "September 1, 2026",
  "sourceFiles": [
    "src/data/featuredComparisons.js",
    "src/lib/prebuiltComparisons.js"
  ],
  "counts": {
    "exportedComparisons": 400,
    "totalPairwiseComparisons": 82215
  },
  "items": [
    {
      "slug": "claude-opus-5-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 81.69,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 0.6500000000000057,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 64,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 22
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 10
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 92.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 18
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 64.72,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 16.97,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 26,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 76.7,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 57.4,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 81.69,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 1.769999999999996,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 92,
          "winner": "B",
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 75.96,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 5.730000000000004,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 26,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 80.3,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 81.1,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 77,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 72.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 53.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "gemini-3-5-flash-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/gemini-3-5-flash-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-5-flash-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 64.2,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 8.299999999999997,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 24,
      "benchmarkCountB": 22,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 77.2,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 55.1,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 83.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": 74.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 40.2,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": 32.9,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-5-flash-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/gemini-3-5-flash-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-5-flash-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "modelB": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.93,
      "scoreB": 64.2,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "scoreDiff": 2.730000000000004,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 24,
      "benchmarkCountB": 22,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.1,
          "avgB": 77.2,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.7,
          "avgB": 55.1,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.4,
          "avgB": 83.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 59.5,
          "avgB": 74.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.3,
          "avgB": 40.2,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 73.6,
          "avgB": 32.9,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-6-flash-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/gemini-3-6-flash-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-6-flash-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "modelB": {
        "slug": "gemini-3-6-flash",
        "canonicalModelKey": "gemini-3-6-flash",
        "model": "Gemini 3.6 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.06,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 70.01,
          "upper": 80.1
        },
        "rankingEligible": true,
        "overallRank": 10,
        "url": "https://benchlm.ai/models/gemini-3-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-6-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61,
      "scoreB": 75.06,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gemini-3-6-flash",
        "canonicalModelKey": "gemini-3-6-flash",
        "model": "Gemini 3.6 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.06,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 70.01,
          "upper": 80.1
        },
        "rankingEligible": true,
        "overallRank": 10,
        "url": "https://benchlm.ai/models/gemini-3-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-6-flash.md"
      },
      "scoreDiff": 14.060000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 1
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gemini-3-5-flash-vs-gemini-3-6-flash",
      "url": "https://benchlm.ai/compare/gemini-3-5-flash-vs-gemini-3-6-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-5-flash-vs-gemini-3-6-flash.md",
      "modelA": {
        "slug": "gemini-3-6-flash",
        "canonicalModelKey": "gemini-3-6-flash",
        "model": "Gemini 3.6 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.06,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 70.01,
          "upper": 80.1
        },
        "rankingEligible": true,
        "overallRank": 10,
        "url": "https://benchlm.ai/models/gemini-3-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-6-flash.md"
      },
      "modelB": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.06,
      "scoreB": 64.2,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gemini-3-6-flash",
        "canonicalModelKey": "gemini-3-6-flash",
        "model": "Gemini 3.6 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.06,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 70.01,
          "upper": 80.1
        },
        "rankingEligible": true,
        "overallRank": 10,
        "url": "https://benchlm.ai/models/gemini-3-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-6-flash.md"
      },
      "scoreDiff": 10.86,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 22,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 83,
          "avgB": 77.2,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 55.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83.8,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 74.7,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 40.2,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 32.9,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gemini-3-1-flash-lite-vs-gemini-3-5-flash-lite",
      "url": "https://benchlm.ai/compare/gemini-3-1-flash-lite-vs-gemini-3-5-flash-lite",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-flash-lite-vs-gemini-3-5-flash-lite.md",
      "modelA": {
        "slug": "gemini-3-5-flash-lite",
        "canonicalModelKey": "gemini-3-5-flash-lite",
        "model": "Gemini 3.5 Flash-Lite",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.04,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 52.89,
          "upper": 77.19
        },
        "rankingEligible": true,
        "overallRank": 37,
        "url": "https://benchlm.ai/models/gemini-3-5-flash-lite",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash-lite.md"
      },
      "modelB": {
        "slug": "gemini-3-1-flash-lite",
        "canonicalModelKey": "gemini-3-1-flash-lite",
        "model": "Gemini 3.1 Flash-Lite",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 50.82,
        "provisionalDisplayScore": 46,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 24.61,
          "upper": 77.03
        },
        "rankingEligible": true,
        "overallRank": 129,
        "url": "https://benchlm.ai/models/gemini-3-1-flash-lite",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-flash-lite.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.04,
      "scoreB": 50.82,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gemini-3-5-flash-lite",
        "canonicalModelKey": "gemini-3-5-flash-lite",
        "model": "Gemini 3.5 Flash-Lite",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.04,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 52.89,
          "upper": 77.19
        },
        "rankingEligible": true,
        "overallRank": 37,
        "url": "https://benchlm.ai/models/gemini-3-5-flash-lite",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash-lite.md"
      },
      "scoreDiff": 14.220000000000006,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 5,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 63.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 54.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 73.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-claude-sonnet-5",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-claude-sonnet-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-claude-sonnet-5.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 75.96,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 11.239999999999995,
      "winsA": 1,
      "winsB": 1,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 16,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 80.3,
          "winner": "A",
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 81.1,
          "winner": "B",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 77,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 72.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 53.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-gpt-5-5.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 3.279999999999987,
      "winsA": 1,
      "winsB": 2,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 33,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 81.6,
          "winner": "B",
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 85,
          "winner": "B",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 57.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-claude-opus-4-8",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-claude-opus-4-8",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-claude-opus-4-8.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 3.75,
      "winsA": 4,
      "winsB": 1,
      "comparableCategoryCount": 5,
      "benchmarkCountA": 33,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 75.1,
          "winner": "A",
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 78.6,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 65.1,
          "winner": "A",
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 75.8,
          "winner": "B",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 60,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "gemini-3-5-flash-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/gemini-3-5-flash-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-5-flash-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.2,
      "scoreB": 72.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 8.480000000000004,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 22,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 77.2,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 55.1,
          "avgB": 58.6,
          "winner": "B",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83.8,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 74.7,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 6
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 40.2,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 32.9,
          "avgB": 47.6,
          "winner": "B",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-gemini-3-5-flash",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-gemini-3-5-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-gemini-3-5-flash.md",
      "modelA": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.2,
      "scoreB": 72.23,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "scoreDiff": 8.030000000000001,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 22,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 77.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 55.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 74.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 40.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 32.9,
          "avgB": 38.6,
          "winner": "B",
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-gemini-3-5-flash",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-gemini-3-5-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-gemini-3-5-flash.md",
      "modelA": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.2,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "scoreDiff": 7.990000000000002,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 22,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 77.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 55.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83.8,
          "avgB": 82.6,
          "winner": "A",
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 74.7,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 40.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 32.9,
          "avgB": 31.8,
          "winner": "A",
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 72.23,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 0.45000000000000284,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 33,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": 38.6,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 72.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 0.4700000000000131,
      "winsA": 2,
      "winsB": 1,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 33,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": 75.1,
          "winner": "A",
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": 75.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": 60,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-fable-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 82.49,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 9.809999999999988,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 12,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": 84.6,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": 89.2,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": 57.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 13.319999999999993,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 33,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 16.470000000000006,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 33,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": 77.1,
          "winner": "A",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": 31.8,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-1-flash-lite-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/gemini-3-1-flash-lite-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-flash-lite-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "gemini-3-1-flash-lite",
        "canonicalModelKey": "gemini-3-1-flash-lite",
        "model": "Gemini 3.1 Flash-Lite",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 50.82,
        "provisionalDisplayScore": 46,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 24.61,
          "upper": 77.03
        },
        "rankingEligible": true,
        "overallRank": 129,
        "url": "https://benchlm.ai/models/gemini-3-1-flash-lite",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-flash-lite.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 50.82,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 21.860000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": 73.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 62.88,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 9.800000000000004,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 33,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": 62.1,
          "winner": "B",
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": 59.6,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "glm-5-1-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/glm-5-1-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-1-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 66.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 6,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": 65.4,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": 61.3,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": 52.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": 62,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-kimi-k2-7-code",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-kimi-k2-7-code",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-kimi-k2-7-code.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "kimi-k2-7-code",
        "canonicalModelKey": "kimi-k2-7-code",
        "model": "Kimi K2.7 Code",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 54.01,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.99,
          "upper": 65.03
        },
        "rankingEligible": true,
        "overallRank": 110,
        "url": "https://benchlm.ai/models/kimi-k2-7-code",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-7-code.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 54.01,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 18.67000000000001,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-gpt-5-5-pro",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-gpt-5-5-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-gpt-5-5-pro.md",
      "modelA": {
        "slug": "gpt-5-5-pro",
        "canonicalModelKey": "gpt-5-5-pro",
        "model": "GPT-5.5 Pro",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.35,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.8,
          "upper": 78.91
        },
        "rankingEligible": true,
        "overallRank": 42,
        "url": "https://benchlm.ai/models/gpt-5-5-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5-pro.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.35,
      "scoreB": 72.23,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "scoreDiff": 7.88000000000001,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 6,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 48.1,
          "avgB": 38.6,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.23,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "scoreDiff": 16.020000000000003,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 8,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 38.6,
          "avgB": 31.8,
          "winner": "A",
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "glm-5-reasoning-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/glm-5-reasoning-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-reasoning-vs-gpt-5-5.md",
      "modelA": {
        "slug": "glm-5-reasoning",
        "canonicalModelKey": "glm-5-reasoning",
        "model": "GLM-5 (Reasoning)",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 60.55,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.04,
          "upper": 72.07
        },
        "rankingEligible": true,
        "overallRank": 67,
        "url": "https://benchlm.ai/models/glm-5-reasoning",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-reasoning.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 60.55,
      "scoreB": 72.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 12.13000000000001,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 1,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-kimi-k2-7-code",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-kimi-k2-7-code",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-kimi-k2-7-code.md",
      "modelA": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "modelB": {
        "slug": "kimi-k2-7-code",
        "canonicalModelKey": "kimi-k2-7-code",
        "model": "Kimi K2.7 Code",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 54.01,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.99,
          "upper": 65.03
        },
        "rankingEligible": true,
        "overallRank": 110,
        "url": "https://benchlm.ai/models/kimi-k2-7-code",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-7-code.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 62.88,
      "scoreB": 54.01,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "scoreDiff": 8.870000000000005,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 20,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 59.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 95.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "glm-5-1-vs-kimi-k2-7-code",
      "url": "https://benchlm.ai/compare/glm-5-1-vs-kimi-k2-7-code",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-1-vs-kimi-k2-7-code.md",
      "modelA": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "modelB": {
        "slug": "kimi-k2-7-code",
        "canonicalModelKey": "kimi-k2-7-code",
        "model": "Kimi K2.7 Code",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 54.01,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.99,
          "upper": 65.03
        },
        "rankingEligible": true,
        "overallRank": 110,
        "url": "https://benchlm.ai/models/kimi-k2-7-code",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-7-code.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.68,
      "scoreB": 54.01,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "scoreDiff": 12.670000000000009,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 21,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 65.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 52.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 62,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "kimi-k2-7-code-vs-ling-2-6-flash",
      "url": "https://benchlm.ai/compare/kimi-k2-7-code-vs-ling-2-6-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k2-7-code-vs-ling-2-6-flash.md",
      "modelA": {
        "slug": "ling-2-6-flash",
        "canonicalModelKey": "ling-2-6-flash",
        "model": "Ling 2.6 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 44.18,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 32.66,
          "upper": 55.69
        },
        "rankingEligible": true,
        "overallRank": 175,
        "url": "https://benchlm.ai/models/ling-2-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-2-6-flash.md"
      },
      "modelB": {
        "slug": "kimi-k2-7-code",
        "canonicalModelKey": "kimi-k2-7-code",
        "model": "Kimi K2.7 Code",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 54.01,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.99,
          "upper": 65.03
        },
        "rankingEligible": true,
        "overallRank": 110,
        "url": "https://benchlm.ai/models/kimi-k2-7-code",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-7-code.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 44.18,
      "scoreB": 54.01,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k2-7-code",
        "canonicalModelKey": "kimi-k2-7-code",
        "model": "Kimi K2.7 Code",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 54.01,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.99,
          "upper": 65.03
        },
        "rankingEligible": true,
        "overallRank": 110,
        "url": "https://benchlm.ai/models/kimi-k2-7-code",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-7-code.md"
      },
      "scoreDiff": 9.829999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-ling-2-6-flash",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-ling-2-6-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-ling-2-6-flash.md",
      "modelA": {
        "slug": "ling-2-6-flash",
        "canonicalModelKey": "ling-2-6-flash",
        "model": "Ling 2.6 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 44.18,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 32.66,
          "upper": 55.69
        },
        "rankingEligible": true,
        "overallRank": 175,
        "url": "https://benchlm.ai/models/ling-2-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-2-6-flash.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 44.18,
      "scoreB": 72.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 28.500000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-1-vs-ling-2-6-flash",
      "url": "https://benchlm.ai/compare/glm-5-1-vs-ling-2-6-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-1-vs-ling-2-6-flash.md",
      "modelA": {
        "slug": "ling-2-6-flash",
        "canonicalModelKey": "ling-2-6-flash",
        "model": "Ling 2.6 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 44.18,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 32.66,
          "upper": 55.69
        },
        "rankingEligible": true,
        "overallRank": 175,
        "url": "https://benchlm.ai/models/ling-2-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-2-6-flash.md"
      },
      "modelB": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 44.18,
      "scoreB": 66.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "scoreDiff": 22.500000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 65.4,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 61.3,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 52.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 62,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-ling-2-6-flash",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-ling-2-6-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-ling-2-6-flash.md",
      "modelA": {
        "slug": "ling-2-6-flash",
        "canonicalModelKey": "ling-2-6-flash",
        "model": "Ling 2.6 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 44.18,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 32.66,
          "upper": 55.69
        },
        "rankingEligible": true,
        "overallRank": 175,
        "url": "https://benchlm.ai/models/ling-2-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-2-6-flash.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 44.18,
      "scoreB": 72.23,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "scoreDiff": 28.050000000000004,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 38.6,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "qwen3-6-27b-vs-qwen3-6-35b-a3b",
      "url": "https://benchlm.ai/compare/qwen3-6-27b-vs-qwen3-6-35b-a3b",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-6-27b-vs-qwen3-6-35b-a3b.md",
      "modelA": {
        "slug": "qwen3-6-27b",
        "canonicalModelKey": "qwen3-6-27b",
        "model": "Qwen3.6-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.57,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.05,
          "upper": 65.08
        },
        "rankingEligible": true,
        "overallRank": 113,
        "url": "https://benchlm.ai/models/qwen3-6-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-27b.md"
      },
      "modelB": {
        "slug": "qwen3-6-35b-a3b",
        "canonicalModelKey": "qwen3-6-35b-a3b",
        "model": "Qwen3.6-35B-A3B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 51.32,
        "provisionalDisplayScore": 41,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 39.81,
          "upper": 62.84
        },
        "rankingEligible": true,
        "overallRank": 123,
        "url": "https://benchlm.ai/models/qwen3-6-35b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-35b-a3b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 53.57,
      "scoreB": 51.32,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-6-27b",
        "canonicalModelKey": "qwen3-6-27b",
        "model": "Qwen3.6-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.57,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.05,
          "upper": 65.08
        },
        "rankingEligible": true,
        "overallRank": 113,
        "url": "https://benchlm.ai/models/qwen3-6-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-27b.md"
      },
      "scoreDiff": 2.25,
      "winsA": 5,
      "winsB": 0,
      "comparableCategoryCount": 5,
      "benchmarkCountA": 38,
      "benchmarkCountB": 41,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 59.3,
          "avgB": 51.5,
          "winner": "A",
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.5,
          "avgB": 73.8,
          "winner": "A",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.7,
          "avgB": 76.3,
          "winner": "A",
          "benchmarkCount": 19
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 53.3,
          "avgB": 51.4,
          "winner": "A",
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 89.2,
          "avgB": 88.2,
          "winner": "A",
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "qwen3-5-27b-vs-qwen3-6-27b",
      "url": "https://benchlm.ai/compare/qwen3-5-27b-vs-qwen3-6-27b",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-5-27b-vs-qwen3-6-27b.md",
      "modelA": {
        "slug": "qwen3-6-27b",
        "canonicalModelKey": "qwen3-6-27b",
        "model": "Qwen3.6-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.57,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.05,
          "upper": 65.08
        },
        "rankingEligible": true,
        "overallRank": 113,
        "url": "https://benchlm.ai/models/qwen3-6-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-27b.md"
      },
      "modelB": {
        "slug": "qwen3-5-27b",
        "canonicalModelKey": "qwen3-5-27b",
        "model": "Qwen3.5-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 59.7,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 49.77,
          "upper": 69.63
        },
        "rankingEligible": true,
        "overallRank": 74,
        "url": "https://benchlm.ai/models/qwen3-5-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-27b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 53.57,
      "scoreB": 59.7,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "qwen3-5-27b",
        "canonicalModelKey": "qwen3-5-27b",
        "model": "Qwen3.5-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 59.7,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 49.77,
          "upper": 69.63
        },
        "rankingEligible": true,
        "overallRank": 74,
        "url": "https://benchlm.ai/models/qwen3-5-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-27b.md"
      },
      "scoreDiff": 6.130000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 38,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 59.3,
          "avgB": 52,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.5,
          "avgB": 64.9,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 60.6,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 53.3,
          "avgB": 82.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 95,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 82.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 89.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "gemma-4-31b-vs-qwen3-6-27b",
      "url": "https://benchlm.ai/compare/gemma-4-31b-vs-qwen3-6-27b",
      "markdownUrl": "https://benchlm.ai/md/compare/gemma-4-31b-vs-qwen3-6-27b.md",
      "modelA": {
        "slug": "qwen3-6-27b",
        "canonicalModelKey": "qwen3-6-27b",
        "model": "Qwen3.6-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.57,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.05,
          "upper": 65.08
        },
        "rankingEligible": true,
        "overallRank": 113,
        "url": "https://benchlm.ai/models/qwen3-6-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-27b.md"
      },
      "modelB": {
        "slug": "gemma-4-31b",
        "canonicalModelKey": "gemma-4-31b",
        "model": "Gemma 4 31B",
        "creator": "Google",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 60.08,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 43.34,
          "upper": 76.82
        },
        "rankingEligible": true,
        "overallRank": 71,
        "url": "https://benchlm.ai/models/gemma-4-31b",
        "markdownUrl": "https://benchlm.ai/md/models/gemma-4-31b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 53.57,
      "scoreB": 60.08,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gemma-4-31b",
        "canonicalModelKey": "gemma-4-31b",
        "model": "Gemma 4 31B",
        "creator": "Google",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 60.08,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 43.34,
          "upper": 76.82
        },
        "rankingEligible": true,
        "overallRank": 71,
        "url": "https://benchlm.ai/models/gemma-4-31b",
        "markdownUrl": "https://benchlm.ai/md/models/gemma-4-31b.md"
      },
      "scoreDiff": 6.509999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 38,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 59.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.5,
          "avgB": 41.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.7,
          "avgB": 76.9,
          "winner": null,
          "benchmarkCount": 15
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 53.3,
          "avgB": 52.9,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 89.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-5-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-5-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-5-pro.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-5-5-pro",
        "canonicalModelKey": "gpt-5-5-pro",
        "model": "GPT-5.5 Pro",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.35,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.8,
          "upper": 78.91
        },
        "rankingEligible": true,
        "overallRank": 42,
        "url": "https://benchlm.ai/models/gpt-5-5-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 64.35,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 21.650000000000006,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 90.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 57.2,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 48.1,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-opus-4-7",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-opus-4-7",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-opus-4-7.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 72.23,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 13.769999999999996,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 38.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-vs-claude-opus-4-8",
      "url": "https://benchlm.ai/compare/claude-fable-vs-claude-opus-4-8",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-claude-opus-4-8.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 75.96,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 6.530000000000001,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 12,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 80.3,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 81.1,
          "winner": "A",
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 77,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 72.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 53.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-3-5-sonnet-vs-grok-4",
      "url": "https://benchlm.ai/compare/claude-3-5-sonnet-vs-grok-4",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-3-5-sonnet-vs-grok-4.md",
      "modelA": {
        "slug": "claude-3-5-sonnet",
        "canonicalModelKey": "claude-3-5-sonnet",
        "model": "Claude 3.5 Sonnet",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 48.36,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 36.85,
          "upper": 59.87
        },
        "rankingEligible": true,
        "overallRank": 144,
        "url": "https://benchlm.ai/models/claude-3-5-sonnet",
        "markdownUrl": "https://benchlm.ai/md/models/claude-3-5-sonnet.md"
      },
      "modelB": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 48.36,
      "scoreB": 59.42,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "scoreDiff": 11.060000000000002,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 4,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 49,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 59.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 1.6,
          "avgB": 15.3,
          "winner": "B",
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gpt-4o-vs-grok-4-1",
      "url": "https://benchlm.ai/compare/gpt-4o-vs-grok-4-1",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-4o-vs-grok-4-1.md",
      "modelA": {
        "slug": "gpt-4o",
        "canonicalModelKey": "gpt-4o",
        "model": "GPT-4o",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 40.96,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 21.58,
          "upper": 60.34
        },
        "rankingEligible": true,
        "overallRank": 191,
        "url": "https://benchlm.ai/models/gpt-4o",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-4o.md"
      },
      "modelB": {
        "slug": "grok-4-1",
        "canonicalModelKey": "grok-4-1",
        "model": "Grok 4.1",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 60.73,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.22,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 65,
        "url": "https://benchlm.ai/models/grok-4-1",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 40.96,
      "scoreB": 60.73,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "grok-4-1",
        "canonicalModelKey": "grok-4-1",
        "model": "Grok 4.1",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 60.73,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.22,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 65,
        "url": "https://benchlm.ai/models/grok-4-1",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-1.md"
      },
      "scoreDiff": 19.769999999999996,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 1,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 0.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "gemini-2-5-pro-vs-o3",
      "url": "https://benchlm.ai/compare/gemini-2-5-pro-vs-o3",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-2-5-pro-vs-o3.md",
      "modelA": {
        "slug": "gemini-2-5-pro",
        "canonicalModelKey": "gemini-2-5-pro",
        "model": "Gemini 2.5 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.77,
        "provisionalDisplayScore": 41,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 38.38,
          "upper": 75.17
        },
        "rankingEligible": true,
        "overallRank": 94,
        "url": "https://benchlm.ai/models/gemini-2-5-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-2-5-pro.md"
      },
      "modelB": {
        "slug": "o3",
        "canonicalModelKey": "o3",
        "model": "o3",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 46.82,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 43.88,
          "upper": 49.76
        },
        "rankingEligible": true,
        "overallRank": 157,
        "url": "https://benchlm.ai/models/o3",
        "markdownUrl": "https://benchlm.ai/md/models/o3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.77,
      "scoreB": 46.82,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gemini-2-5-pro",
        "canonicalModelKey": "gemini-2-5-pro",
        "model": "Gemini 2.5 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.77,
        "provisionalDisplayScore": 41,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 38.38,
          "upper": 75.17
        },
        "rankingEligible": true,
        "overallRank": 94,
        "url": "https://benchlm.ai/models/gemini-2-5-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-2-5-pro.md"
      },
      "scoreDiff": 9.950000000000003,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 7,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 27.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 11.6,
          "avgB": 14.5,
          "winner": "B",
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "kimi-2-6-vs-kimi-k2-7-code",
      "url": "https://benchlm.ai/compare/kimi-2-6-vs-kimi-k2-7-code",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-2-6-vs-kimi-k2-7-code.md",
      "modelA": {
        "slug": "kimi-k2-7-code",
        "canonicalModelKey": "kimi-k2-7-code",
        "model": "Kimi K2.7 Code",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 54.01,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.99,
          "upper": 65.03
        },
        "rankingEligible": true,
        "overallRank": 110,
        "url": "https://benchlm.ai/models/kimi-k2-7-code",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-7-code.md"
      },
      "modelB": {
        "slug": "kimi-2-6",
        "canonicalModelKey": "kimi-2-6",
        "model": "Kimi K2.6",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 59.09,
        "provisionalDisplayScore": 62,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.22,
          "upper": 68.96
        },
        "rankingEligible": true,
        "overallRank": 81,
        "url": "https://benchlm.ai/models/kimi-2-6",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-2-6.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 54.01,
      "scoreB": 59.09,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-2-6",
        "canonicalModelKey": "kimi-2-6",
        "model": "Kimi K2.6",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 59.09,
        "provisionalDisplayScore": 62,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.22,
          "upper": 68.96
        },
        "rankingEligible": true,
        "overallRank": 81,
        "url": "https://benchlm.ai/models/kimi-2-6",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-2-6.md"
      },
      "scoreDiff": 5.080000000000005,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 8,
      "benchmarkCountB": 32,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 73.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 64.4,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 79.8,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 42.2,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 67.1,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-grok-4-20-beta",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-grok-4-20-beta",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-grok-4-20-beta.md",
      "modelA": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "modelB": {
        "slug": "grok-4-20-beta",
        "canonicalModelKey": "grok-4-20-beta",
        "model": "Grok 4.20",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "2M",
        "contextWindowTokens": 2000000,
        "displayScore": 55.42,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 38.52,
          "upper": 72.32
        },
        "rankingEligible": true,
        "overallRank": 102,
        "url": "https://benchlm.ai/models/grok-4-20-beta",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-20-beta.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.23,
      "scoreB": 55.42,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "scoreDiff": 16.810000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 8,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 47.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 67.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 70.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 53.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 38.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gpt-4o-vs-grok-4",
      "url": "https://benchlm.ai/compare/gpt-4o-vs-grok-4",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-4o-vs-grok-4.md",
      "modelA": {
        "slug": "gpt-4o",
        "canonicalModelKey": "gpt-4o",
        "model": "GPT-4o",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 40.96,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 21.58,
          "upper": 60.34
        },
        "rankingEligible": true,
        "overallRank": 191,
        "url": "https://benchlm.ai/models/gpt-4o",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-4o.md"
      },
      "modelB": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 40.96,
      "scoreB": 59.42,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "scoreDiff": 18.46,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 1,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 0.3,
          "avgB": 15.3,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-4-1-opus-thinking-vs-grok-4",
      "url": "https://benchlm.ai/compare/claude-4-1-opus-thinking-vs-grok-4",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-4-1-opus-thinking-vs-grok-4.md",
      "modelA": {
        "slug": "claude-4-1-opus-thinking",
        "canonicalModelKey": "claude-4-1-opus-thinking",
        "model": "Claude 4.1 Opus Thinking",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 35.27,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 16.26,
          "upper": 54.27
        },
        "rankingEligible": true,
        "overallRank": 206,
        "url": "https://benchlm.ai/models/claude-4-1-opus-thinking",
        "markdownUrl": "https://benchlm.ai/md/models/claude-4-1-opus-thinking.md"
      },
      "modelB": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 35.27,
      "scoreB": 59.42,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "scoreDiff": 24.15,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 15.3,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-grok-4-1-fast",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-grok-4-1-fast",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-grok-4-1-fast.md",
      "modelA": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "modelB": {
        "slug": "grok-4-1-fast",
        "canonicalModelKey": "grok-4-1-fast",
        "model": "Grok 4.1 Fast",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 50.66,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 28.09,
          "upper": 73.22
        },
        "rankingEligible": true,
        "overallRank": 131,
        "url": "https://benchlm.ai/models/grok-4-1-fast",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-1-fast.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.23,
      "scoreB": 50.66,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "scoreDiff": 21.570000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 8,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 38.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-grok-3-beta",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-grok-3-beta",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-grok-3-beta.md",
      "modelA": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "modelB": {
        "slug": "grok-3-beta",
        "canonicalModelKey": "grok-3-beta",
        "model": "Grok 3 [Beta]",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 40.33,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 8.65,
          "upper": 72
        },
        "rankingEligible": true,
        "overallRank": 197,
        "url": "https://benchlm.ai/models/grok-3-beta",
        "markdownUrl": "https://benchlm.ai/md/models/grok-3-beta.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.21,
      "scoreB": 40.33,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "scoreDiff": 15.880000000000003,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 23,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 82.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 77.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 31.8,
          "avgB": 2.8,
          "winner": "A",
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-4-sonnet-vs-grok-4",
      "url": "https://benchlm.ai/compare/claude-4-sonnet-vs-grok-4",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-4-sonnet-vs-grok-4.md",
      "modelA": {
        "slug": "claude-4-sonnet",
        "canonicalModelKey": "claude-4-sonnet",
        "model": "Claude 4 Sonnet",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 42.07,
        "provisionalDisplayScore": 56,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 38.83,
          "upper": 45.31
        },
        "rankingEligible": true,
        "overallRank": 187,
        "url": "https://benchlm.ai/models/claude-4-sonnet",
        "markdownUrl": "https://benchlm.ai/md/models/claude-4-sonnet.md"
      },
      "modelB": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 42.07,
      "scoreB": 59.42,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "scoreDiff": 17.35,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 72.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 15.3,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-opus-4-7-vs-gpt-4o",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-vs-gpt-4o",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-vs-gpt-4o.md",
      "modelA": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "modelB": {
        "slug": "gpt-4o",
        "canonicalModelKey": "gpt-4o",
        "model": "GPT-4o",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 40.96,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 21.58,
          "upper": 60.34
        },
        "rankingEligible": true,
        "overallRank": 191,
        "url": "https://benchlm.ai/models/gpt-4o",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-4o.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.23,
      "scoreB": 40.96,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-7",
        "canonicalModelKey": "claude-opus-4-7",
        "model": "Claude Opus 4.7",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.23,
        "provisionalDisplayScore": 65,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.3,
          "upper": 84.15
        },
        "rankingEligible": true,
        "overallRank": 15,
        "url": "https://benchlm.ai/models/claude-opus-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7.md"
      },
      "scoreDiff": 31.270000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 8,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 38.6,
          "avgB": 0.3,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-fable-vs-claude-fable-5-1",
      "url": "https://benchlm.ai/compare/claude-fable-vs-claude-fable-5-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-claude-fable-5-1.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 82.49,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 0.25,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 18,
      "benchmarkCountB": 12,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 84.6,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 89.2,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 57.9,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-claude-mythos-5-1",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-claude-mythos-5-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-claude-mythos-5-1.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "claude-mythos-5-1",
        "canonicalModelKey": "claude-mythos-5-1",
        "model": "Claude Mythos 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 0,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 82.74,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 18,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-claude-opus-5.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 82.34,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 0.3999999999999915,
      "winsA": 1,
      "winsB": 1,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 18,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 90.4,
          "winner": "B",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 64.7,
          "winner": "A",
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-kimi-k3.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 79.92,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 2.819999999999993,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 18,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 81.69,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 1.0499999999999972,
      "winsA": 1,
      "winsB": 1,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 18,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 64.6,
          "winner": "A",
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 92.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-mythos-5-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-mythos-5-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-mythos-5-1.md",
      "modelA": {
        "slug": "claude-mythos-5-1",
        "canonicalModelKey": "claude-mythos-5-1",
        "model": "Claude Mythos 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5-1.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 86,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 86,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 1,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-1-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-1-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-1-vs-claude-opus-5.md",
      "modelA": {
        "slug": "claude-mythos-5-1",
        "canonicalModelKey": "claude-mythos-5-1",
        "model": "Claude Mythos 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5-1.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.34,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 82.34,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 1,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-1-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-1-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-1-vs-kimi-k3.md",
      "modelA": {
        "slug": "claude-mythos-5-1",
        "canonicalModelKey": "claude-mythos-5-1",
        "model": "Claude Mythos 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5-1.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 79.92,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 79.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 1,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-mythos-5-1-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-mythos-5-1-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-1-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "claude-mythos-5-1",
        "canonicalModelKey": "claude-mythos-5-1",
        "model": "Claude Mythos 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5-1.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 81.69,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 81.69,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 1,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-muse-voice-transcribe",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-muse-voice-transcribe",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-muse-voice-transcribe.md",
      "modelA": {
        "slug": "muse-voice-transcribe",
        "canonicalModelKey": "muse-voice-transcribe",
        "model": "Muse Voice Transcribe",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/muse-voice-transcribe",
        "markdownUrl": "https://benchlm.ai/md/models/muse-voice-transcribe.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.34,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 82.34,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "kimi-k3-vs-muse-voice-transcribe",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-muse-voice-transcribe",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-muse-voice-transcribe.md",
      "modelA": {
        "slug": "muse-voice-transcribe",
        "canonicalModelKey": "muse-voice-transcribe",
        "model": "Muse Voice Transcribe",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/muse-voice-transcribe",
        "markdownUrl": "https://benchlm.ai/md/models/muse-voice-transcribe.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 79.92,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 79.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-muse-voice-transcribe",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-muse-voice-transcribe",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-muse-voice-transcribe.md",
      "modelA": {
        "slug": "muse-voice-transcribe",
        "canonicalModelKey": "muse-voice-transcribe",
        "model": "Muse Voice Transcribe",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/muse-voice-transcribe",
        "markdownUrl": "https://benchlm.ai/md/models/muse-voice-transcribe.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 81.69,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 81.69,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-muse-voice-transcribe",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-muse-voice-transcribe",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-muse-voice-transcribe.md",
      "modelA": {
        "slug": "muse-voice-transcribe",
        "canonicalModelKey": "muse-voice-transcribe",
        "model": "Muse Voice Transcribe",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/muse-voice-transcribe",
        "markdownUrl": "https://benchlm.ai/md/models/muse-voice-transcribe.md"
      },
      "modelB": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.74,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 82.74,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 81.2,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 65,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-vs-muse-voice-transcribe",
      "url": "https://benchlm.ai/compare/claude-fable-vs-muse-voice-transcribe",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-muse-voice-transcribe.md",
      "modelA": {
        "slug": "muse-voice-transcribe",
        "canonicalModelKey": "muse-voice-transcribe",
        "model": "Muse Voice Transcribe",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/muse-voice-transcribe",
        "markdownUrl": "https://benchlm.ai/md/models/muse-voice-transcribe.md"
      },
      "modelB": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.49,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 82.49,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 12,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 84.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.2,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 57.9,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "mercury-2-vs-mercury-2-5-preview",
      "url": "https://benchlm.ai/compare/mercury-2-vs-mercury-2-5-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/mercury-2-vs-mercury-2-5-preview.md",
      "modelA": {
        "slug": "mercury-2-5-preview",
        "canonicalModelKey": "mercury-2-5-preview",
        "model": "Mercury 2.5 Preview",
        "creator": "Inception",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "260K",
        "contextWindowTokens": 260000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mercury-2-5-preview",
        "markdownUrl": "https://benchlm.ai/md/models/mercury-2-5-preview.md"
      },
      "modelB": {
        "slug": "mercury-2",
        "canonicalModelKey": "mercury-2",
        "model": "Mercury 2",
        "creator": "Inception",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 48.13,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 34.94,
          "upper": 61.33
        },
        "rankingEligible": true,
        "overallRank": 147,
        "url": "https://benchlm.ai/models/mercury-2",
        "markdownUrl": "https://benchlm.ai/md/models/mercury-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 48.13,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "mercury-2",
        "canonicalModelKey": "mercury-2",
        "model": "Mercury 2",
        "creator": "Inception",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 48.13,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 34.94,
          "upper": 61.33
        },
        "rankingEligible": true,
        "overallRank": 147,
        "url": "https://benchlm.ai/models/mercury-2",
        "markdownUrl": "https://benchlm.ai/md/models/mercury-2.md"
      },
      "scoreDiff": 48.13,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-mercury-2-5-preview",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-mercury-2-5-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-mercury-2-5-preview.md",
      "modelA": {
        "slug": "mercury-2-5-preview",
        "canonicalModelKey": "mercury-2-5-preview",
        "model": "Mercury 2.5 Preview",
        "creator": "Inception",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "260K",
        "contextWindowTokens": 260000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mercury-2-5-preview",
        "markdownUrl": "https://benchlm.ai/md/models/mercury-2-5-preview.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.34,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 82.34,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "kimi-k3-vs-mercury-2-5-preview",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-mercury-2-5-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-mercury-2-5-preview.md",
      "modelA": {
        "slug": "mercury-2-5-preview",
        "canonicalModelKey": "mercury-2-5-preview",
        "model": "Mercury 2.5 Preview",
        "creator": "Inception",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "260K",
        "contextWindowTokens": 260000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mercury-2-5-preview",
        "markdownUrl": "https://benchlm.ai/md/models/mercury-2-5-preview.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 79.92,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 79.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-mercury-2-5-preview",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-mercury-2-5-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-mercury-2-5-preview.md",
      "modelA": {
        "slug": "mercury-2-5-preview",
        "canonicalModelKey": "mercury-2-5-preview",
        "model": "Mercury 2.5 Preview",
        "creator": "Inception",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "260K",
        "contextWindowTokens": 260000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mercury-2-5-preview",
        "markdownUrl": "https://benchlm.ai/md/models/mercury-2-5-preview.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 81.69,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 81.69,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-mercury-2-5-preview",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-mercury-2-5-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-mercury-2-5-preview.md",
      "modelA": {
        "slug": "mercury-2-5-preview",
        "canonicalModelKey": "mercury-2-5-preview",
        "model": "Mercury 2.5 Preview",
        "creator": "Inception",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "260K",
        "contextWindowTokens": 260000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mercury-2-5-preview",
        "markdownUrl": "https://benchlm.ai/md/models/mercury-2-5-preview.md"
      },
      "modelB": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.74,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 82.74,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 81.2,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 65,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "hy3-vs-hy4-preview",
      "url": "https://benchlm.ai/compare/hy3-vs-hy4-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/hy3-vs-hy4-preview.md",
      "modelA": {
        "slug": "hy4-preview",
        "canonicalModelKey": "hy4-preview",
        "model": "Hy4 preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.3,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 68.43,
          "upper": 88.17
        },
        "rankingEligible": true,
        "overallRank": 7,
        "url": "https://benchlm.ai/models/hy4-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy4-preview.md"
      },
      "modelB": {
        "slug": "hy3",
        "canonicalModelKey": "hy3",
        "model": "Hy3",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 67.65,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 58.81,
          "upper": 76.49
        },
        "rankingEligible": true,
        "overallRank": 24,
        "url": "https://benchlm.ai/models/hy3",
        "markdownUrl": "https://benchlm.ai/md/models/hy3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.3,
      "scoreB": 67.65,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "hy4-preview",
        "canonicalModelKey": "hy4-preview",
        "model": "Hy4 preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.3,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 68.43,
          "upper": 88.17
        },
        "rankingEligible": true,
        "overallRank": 7,
        "url": "https://benchlm.ai/models/hy4-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy4-preview.md"
      },
      "scoreDiff": 10.649999999999991,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 28,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 65.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-hy4-preview",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-hy4-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-hy4-preview.md",
      "modelA": {
        "slug": "hy4-preview",
        "canonicalModelKey": "hy4-preview",
        "model": "Hy4 preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.3,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 68.43,
          "upper": 88.17
        },
        "rankingEligible": true,
        "overallRank": 7,
        "url": "https://benchlm.ai/models/hy4-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy4-preview.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.3,
      "scoreB": 82.34,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 4.040000000000006,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 28,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 26
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 65.7,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.2,
          "avgB": 66.9,
          "winner": "B",
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.4,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "hy4-preview-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/hy4-preview-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/hy4-preview-vs-kimi-k3.md",
      "modelA": {
        "slug": "hy4-preview",
        "canonicalModelKey": "hy4-preview",
        "model": "Hy4 preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.3,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 68.43,
          "upper": 88.17
        },
        "rankingEligible": true,
        "overallRank": 7,
        "url": "https://benchlm.ai/models/hy4-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy4-preview.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.3,
      "scoreB": 79.92,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 1.6200000000000045,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 28,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 65.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.2,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.4,
          "avgB": 61,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-hy4-preview",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-hy4-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-hy4-preview.md",
      "modelA": {
        "slug": "hy4-preview",
        "canonicalModelKey": "hy4-preview",
        "model": "Hy4 preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.3,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 68.43,
          "upper": 88.17
        },
        "rankingEligible": true,
        "overallRank": 7,
        "url": "https://benchlm.ai/models/hy4-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy4-preview.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.3,
      "scoreB": 81.69,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 3.3900000000000006,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 28,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 65.7,
          "avgB": 64.6,
          "winner": "A",
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.2,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.4,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-hy4-preview",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-hy4-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-hy4-preview.md",
      "modelA": {
        "slug": "hy4-preview",
        "canonicalModelKey": "hy4-preview",
        "model": "Hy4 preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.3,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 68.43,
          "upper": 88.17
        },
        "rankingEligible": true,
        "overallRank": 7,
        "url": "https://benchlm.ai/models/hy4-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy4-preview.md"
      },
      "modelB": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.3,
      "scoreB": 82.74,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 4.439999999999998,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 28,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 65.7,
          "avgB": 81.2,
          "winner": "B",
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.4,
          "avgB": 65,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "ling-3-0-flash-vs-ling-3-0-flash-fin",
      "url": "https://benchlm.ai/compare/ling-3-0-flash-vs-ling-3-0-flash-fin",
      "markdownUrl": "https://benchlm.ai/md/compare/ling-3-0-flash-vs-ling-3-0-flash-fin.md",
      "modelA": {
        "slug": "ling-3-0-flash-fin",
        "canonicalModelKey": "ling-3-0-flash-fin",
        "model": "Ling 3.0 Flash Fin",
        "creator": "InclusionAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fin",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fin.md"
      },
      "modelB": {
        "slug": "ling-3-0-flash",
        "canonicalModelKey": "ling-3-0-flash",
        "model": "Ling 3.0 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.62,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.1,
          "upper": 65.13
        },
        "rankingEligible": true,
        "overallRank": 112,
        "url": "https://benchlm.ai/models/ling-3-0-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 53.62,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "ling-3-0-flash",
        "canonicalModelKey": "ling-3-0-flash",
        "model": "Ling 3.0 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.62,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.1,
          "upper": 65.13
        },
        "rankingEligible": true,
        "overallRank": 112,
        "url": "https://benchlm.ai/models/ling-3-0-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash.md"
      },
      "scoreDiff": 53.62,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 17,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 72.2,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 47.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 31.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 74.5,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 90.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "ling-3-0-flash-fin-vs-ling-3-0-flash-fp8",
      "url": "https://benchlm.ai/compare/ling-3-0-flash-fin-vs-ling-3-0-flash-fp8",
      "markdownUrl": "https://benchlm.ai/md/compare/ling-3-0-flash-fin-vs-ling-3-0-flash-fp8.md",
      "modelA": {
        "slug": "ling-3-0-flash-fin",
        "canonicalModelKey": "ling-3-0-flash-fin",
        "model": "Ling 3.0 Flash Fin",
        "creator": "InclusionAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fin",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fin.md"
      },
      "modelB": {
        "slug": "ling-3-0-flash-fp8",
        "canonicalModelKey": "ling-3-0-flash-fp8",
        "model": "Ling 3.0 Flash FP8",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fp8",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fp8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 57,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "ling-3-0-flash-fp8",
        "canonicalModelKey": "ling-3-0-flash-fp8",
        "model": "Ling 3.0 Flash FP8",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fp8",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fp8.md"
      },
      "scoreDiff": 57,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 40.4,
          "winner": null,
          "benchmarkCount": 1
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 84,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 73.4,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-ling-3-0-flash-fin",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-ling-3-0-flash-fin",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-ling-3-0-flash-fin.md",
      "modelA": {
        "slug": "ling-3-0-flash-fin",
        "canonicalModelKey": "ling-3-0-flash-fin",
        "model": "Ling 3.0 Flash Fin",
        "creator": "InclusionAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fin",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fin.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.34,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 82.34,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 21
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "kimi-k3-vs-ling-3-0-flash-fin",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-ling-3-0-flash-fin",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-ling-3-0-flash-fin.md",
      "modelA": {
        "slug": "ling-3-0-flash-fin",
        "canonicalModelKey": "ling-3-0-flash-fin",
        "model": "Ling 3.0 Flash Fin",
        "creator": "InclusionAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fin",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fin.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 79.92,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 79.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-ling-3-0-flash-fin",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-ling-3-0-flash-fin",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-ling-3-0-flash-fin.md",
      "modelA": {
        "slug": "ling-3-0-flash-fin",
        "canonicalModelKey": "ling-3-0-flash-fin",
        "model": "Ling 3.0 Flash Fin",
        "creator": "InclusionAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fin",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fin.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 81.69,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 81.69,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-3-vs-glm-5-3-flash",
      "url": "https://benchlm.ai/compare/glm-5-3-vs-glm-5-3-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-3-vs-glm-5-3-flash.md",
      "modelA": {
        "slug": "glm-5-3-flash",
        "canonicalModelKey": "glm-5-3-flash",
        "model": "GLM-5.3-Flash",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.25,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.73,
          "upper": 72.76
        },
        "rankingEligible": true,
        "overallRank": 56,
        "url": "https://benchlm.ai/models/glm-5-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3-flash.md"
      },
      "modelB": {
        "slug": "glm-5-3",
        "canonicalModelKey": "glm-5-3",
        "model": "GLM-5.3",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.41,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 50.9,
          "upper": 73.93
        },
        "rankingEligible": true,
        "overallRank": 50,
        "url": "https://benchlm.ai/models/glm-5-3",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61.25,
      "scoreB": 62.41,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "glm-5-3",
        "canonicalModelKey": "glm-5-3",
        "model": "GLM-5.3",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.41,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 50.9,
          "upper": 73.93
        },
        "rankingEligible": true,
        "overallRank": 50,
        "url": "https://benchlm.ai/models/glm-5-3",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3.md"
      },
      "scoreDiff": 1.1599999999999966,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 13,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 74.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "glm-5-2-vs-glm-5-3-flash",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-glm-5-3-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-glm-5-3-flash.md",
      "modelA": {
        "slug": "glm-5-3-flash",
        "canonicalModelKey": "glm-5-3-flash",
        "model": "GLM-5.3-Flash",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.25,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.73,
          "upper": 72.76
        },
        "rankingEligible": true,
        "overallRank": 56,
        "url": "https://benchlm.ai/models/glm-5-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3-flash.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61.25,
      "scoreB": 62.88,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "scoreDiff": 1.6300000000000026,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 13,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 74.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "glm-5-1-vs-glm-5-3-flash",
      "url": "https://benchlm.ai/compare/glm-5-1-vs-glm-5-3-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-1-vs-glm-5-3-flash.md",
      "modelA": {
        "slug": "glm-5-3-flash",
        "canonicalModelKey": "glm-5-3-flash",
        "model": "GLM-5.3-Flash",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.25,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.73,
          "upper": 72.76
        },
        "rankingEligible": true,
        "overallRank": 56,
        "url": "https://benchlm.ai/models/glm-5-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3-flash.md"
      },
      "modelB": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61.25,
      "scoreB": 66.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "scoreDiff": 5.430000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 13,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 65.4,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 61.3,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 74.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 52.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 62,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "glm-5-vs-glm-5-3-flash",
      "url": "https://benchlm.ai/compare/glm-5-vs-glm-5-3-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-vs-glm-5-3-flash.md",
      "modelA": {
        "slug": "glm-5-3-flash",
        "canonicalModelKey": "glm-5-3-flash",
        "model": "GLM-5.3-Flash",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.25,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.73,
          "upper": 72.76
        },
        "rankingEligible": true,
        "overallRank": 56,
        "url": "https://benchlm.ai/models/glm-5-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3-flash.md"
      },
      "modelB": {
        "slug": "glm-5",
        "canonicalModelKey": "glm-5",
        "model": "GLM-5",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 65.49,
        "provisionalDisplayScore": 56,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 53.78,
          "upper": 77.2
        },
        "rankingEligible": true,
        "overallRank": 35,
        "url": "https://benchlm.ai/models/glm-5",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61.25,
      "scoreB": 65.49,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "glm-5",
        "canonicalModelKey": "glm-5",
        "model": "GLM-5",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 65.49,
        "provisionalDisplayScore": 56,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 53.78,
          "upper": 77.2
        },
        "rankingEligible": true,
        "overallRank": 35,
        "url": "https://benchlm.ai/models/glm-5",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5.md"
      },
      "scoreDiff": 4.239999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 13,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 56.2,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 66.3,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 74.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 60.8,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 66.4,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 92.6,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 83.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 56.3,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "glm-5-3-flash-vs-glm-5-reasoning",
      "url": "https://benchlm.ai/compare/glm-5-3-flash-vs-glm-5-reasoning",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-3-flash-vs-glm-5-reasoning.md",
      "modelA": {
        "slug": "glm-5-3-flash",
        "canonicalModelKey": "glm-5-3-flash",
        "model": "GLM-5.3-Flash",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.25,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.73,
          "upper": 72.76
        },
        "rankingEligible": true,
        "overallRank": 56,
        "url": "https://benchlm.ai/models/glm-5-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3-flash.md"
      },
      "modelB": {
        "slug": "glm-5-reasoning",
        "canonicalModelKey": "glm-5-reasoning",
        "model": "GLM-5 (Reasoning)",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 60.55,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.04,
          "upper": 72.07
        },
        "rankingEligible": true,
        "overallRank": 67,
        "url": "https://benchlm.ai/models/glm-5-reasoning",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-reasoning.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61.25,
      "scoreB": 60.55,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "glm-5-3-flash",
        "canonicalModelKey": "glm-5-3-flash",
        "model": "GLM-5.3-Flash",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.25,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.73,
          "upper": 72.76
        },
        "rankingEligible": true,
        "overallRank": 56,
        "url": "https://benchlm.ai/models/glm-5-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3-flash.md"
      },
      "scoreDiff": 0.7000000000000028,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 13,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 74.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "qwen3-8-27b-vs-qwen3-8-flash-next",
      "url": "https://benchlm.ai/compare/qwen3-8-27b-vs-qwen3-8-flash-next",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-8-27b-vs-qwen3-8-flash-next.md",
      "modelA": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "modelB": {
        "slug": "qwen3-8-27b",
        "canonicalModelKey": "qwen3-8-27b",
        "model": "Qwen3.8-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 71.9,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 69.73,
          "upper": 74.07
        },
        "rankingEligible": true,
        "overallRank": 17,
        "url": "https://benchlm.ai/models/qwen3-8-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-27b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 60.91,
      "scoreB": 71.9,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "qwen3-8-27b",
        "canonicalModelKey": "qwen3-8-27b",
        "model": "Qwen3.8-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 71.9,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 69.73,
          "upper": 74.07
        },
        "rankingEligible": true,
        "overallRank": 17,
        "url": "https://benchlm.ai/models/qwen3-8-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-27b.md"
      },
      "scoreDiff": 10.990000000000009,
      "winsA": 4,
      "winsB": 0,
      "comparableCategoryCount": 4,
      "benchmarkCountA": 24,
      "benchmarkCountB": 28,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 84.3,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.5,
          "avgB": 61.7,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 90.6,
          "avgB": 90.2,
          "winner": "A",
          "benchmarkCount": 11
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 43.4,
          "avgB": 38.7,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 81.3,
          "avgB": 79.5,
          "winner": "A",
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "qwen3-8-flash-next-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/qwen3-8-flash-next-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-8-flash-next-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "modelB": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 60.91,
      "scoreB": 78.55,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 17.64,
      "winsA": 0,
      "winsB": 3,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 24,
      "benchmarkCountB": 54,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.5,
          "avgB": 67.7,
          "winner": "B",
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 90.6,
          "avgB": 86.3,
          "winner": null,
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 78.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 43.4,
          "avgB": 50.2,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 81.3,
          "avgB": 82.8,
          "winner": "B",
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "qwen3-7-flash-vs-qwen3-8-flash-next",
      "url": "https://benchlm.ai/compare/qwen3-7-flash-vs-qwen3-8-flash-next",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-7-flash-vs-qwen3-8-flash-next.md",
      "modelA": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "modelB": {
        "slug": "qwen3-7-flash",
        "canonicalModelKey": "qwen3-7-flash",
        "model": "Qwen3.7 Flash",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/qwen3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 60.91,
      "scoreB": 0,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "scoreDiff": 60.91,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 90.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 43.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 81.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "qwen3-5-flash-vs-qwen3-8-flash-next",
      "url": "https://benchlm.ai/compare/qwen3-5-flash-vs-qwen3-8-flash-next",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-5-flash-vs-qwen3-8-flash-next.md",
      "modelA": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "modelB": {
        "slug": "qwen3-5-flash",
        "canonicalModelKey": "qwen3-5-flash",
        "model": "Qwen3.5 Flash",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 47.56,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 24.54,
          "upper": 70.59
        },
        "rankingEligible": true,
        "overallRank": 152,
        "url": "https://benchlm.ai/models/qwen3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 60.91,
      "scoreB": 47.56,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "scoreDiff": 13.349999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 90.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 43.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 81.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 4.7,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-qwen3-8-flash-next",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-qwen3-8-flash-next",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-qwen3-8-flash-next.md",
      "modelA": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 60.91,
      "scoreB": 82.34,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 21.430000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 22
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.5,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 90.6,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 43.4,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 81.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "granite-4-0-h-1b-vs-granite-4-2-8b",
      "url": "https://benchlm.ai/compare/granite-4-0-h-1b-vs-granite-4-2-8b",
      "markdownUrl": "https://benchlm.ai/md/compare/granite-4-0-h-1b-vs-granite-4-2-8b.md",
      "modelA": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "modelB": {
        "slug": "granite-4-0-h-1b",
        "canonicalModelKey": "granite-4-0-h-1b",
        "model": "Granite-4.0-H-1B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/granite-4-0-h-1b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-0-h-1b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 46.32,
      "scoreB": 0,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "scoreDiff": 46.32,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 14,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 36.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 72.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 79.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "granite-4-0-1b-vs-granite-4-2-8b",
      "url": "https://benchlm.ai/compare/granite-4-0-1b-vs-granite-4-2-8b",
      "markdownUrl": "https://benchlm.ai/md/compare/granite-4-0-1b-vs-granite-4-2-8b.md",
      "modelA": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "modelB": {
        "slug": "granite-4-0-1b",
        "canonicalModelKey": "granite-4-0-1b",
        "model": "Granite-4.0-1B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/granite-4-0-1b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-0-1b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 46.32,
      "scoreB": 0,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "scoreDiff": 46.32,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 14,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 36.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 72.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 79.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-granite-4-2-8b",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-granite-4-2-8b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-granite-4-2-8b.md",
      "modelA": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 46.32,
      "scoreB": 82.34,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 36.02,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 14,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 21
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 36.5,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 15
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 72.2,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 79.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "granite-4-2-8b-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/granite-4-2-8b-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/granite-4-2-8b-vs-kimi-k3.md",
      "modelA": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 46.32,
      "scoreB": 79.92,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 33.6,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 14,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 36.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 72.2,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 79.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-granite-4-2-8b",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-granite-4-2-8b",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-granite-4-2-8b.md",
      "modelA": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 46.32,
      "scoreB": 81.69,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 35.37,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 14,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 36.5,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 72.2,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 79.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "apodex-1-1-vs-apodex-1-1-mini",
      "url": "https://benchlm.ai/compare/apodex-1-1-vs-apodex-1-1-mini",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-vs-apodex-1-1-mini.md",
      "modelA": {
        "slug": "apodex-1-1",
        "canonicalModelKey": "apodex-1-1",
        "model": "Apodex 1.1",
        "creator": "Apodex",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": 56.11,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.6,
          "upper": 67.63
        },
        "rankingEligible": true,
        "overallRank": 99,
        "url": "https://benchlm.ai/models/apodex-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1.md"
      },
      "modelB": {
        "slug": "apodex-1-1-mini",
        "canonicalModelKey": "apodex-1-1-mini",
        "model": "Apodex 1.1 Mini",
        "creator": "Apodex",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/apodex-1-1-mini",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1-mini.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.11,
      "scoreB": 0,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "apodex-1-1",
        "canonicalModelKey": "apodex-1-1",
        "model": "Apodex 1.1",
        "creator": "Apodex",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": 56.11,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.6,
          "upper": 67.63
        },
        "rankingEligible": true,
        "overallRank": 99,
        "url": "https://benchlm.ai/models/apodex-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1.md"
      },
      "scoreDiff": 56.11,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 10,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 56.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "apodex-1-1-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/apodex-1-1-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-vs-claude-opus-5.md",
      "modelA": {
        "slug": "apodex-1-1",
        "canonicalModelKey": "apodex-1-1",
        "model": "Apodex 1.1",
        "creator": "Apodex",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": 56.11,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.6,
          "upper": 67.63
        },
        "rankingEligible": true,
        "overallRank": 99,
        "url": "https://benchlm.ai/models/apodex-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.11,
      "scoreB": 82.34,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 26.230000000000004,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 10,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.7,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 56.1,
          "avgB": 64.7,
          "winner": "B",
          "benchmarkCount": 16
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "apodex-1-1-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/apodex-1-1-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-vs-kimi-k3.md",
      "modelA": {
        "slug": "apodex-1-1",
        "canonicalModelKey": "apodex-1-1",
        "model": "Apodex 1.1",
        "creator": "Apodex",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": 56.11,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.6,
          "upper": 67.63
        },
        "rankingEligible": true,
        "overallRank": 99,
        "url": "https://benchlm.ai/models/apodex-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.11,
      "scoreB": 79.92,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 23.810000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 10,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 56.1,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "apodex-1-1-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/apodex-1-1-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "apodex-1-1",
        "canonicalModelKey": "apodex-1-1",
        "model": "Apodex 1.1",
        "creator": "Apodex",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": 56.11,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.6,
          "upper": 67.63
        },
        "rankingEligible": true,
        "overallRank": 99,
        "url": "https://benchlm.ai/models/apodex-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.11,
      "scoreB": 81.69,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 25.58,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 10,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.7,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 56.1,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "apodex-1-1-vs-claude-fable-5-1",
      "url": "https://benchlm.ai/compare/apodex-1-1-vs-claude-fable-5-1",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-vs-claude-fable-5-1.md",
      "modelA": {
        "slug": "apodex-1-1",
        "canonicalModelKey": "apodex-1-1",
        "model": "Apodex 1.1",
        "creator": "Apodex",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": 56.11,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.6,
          "upper": 67.63
        },
        "rankingEligible": true,
        "overallRank": 99,
        "url": "https://benchlm.ai/models/apodex-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1.md"
      },
      "modelB": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.11,
      "scoreB": 82.74,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 26.629999999999995,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 10,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.7,
          "avgB": 81.2,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 56.1,
          "avgB": 65,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "apodex-1-1-mini-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/apodex-1-1-mini-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-mini-vs-claude-opus-5.md",
      "modelA": {
        "slug": "apodex-1-1-mini",
        "canonicalModelKey": "apodex-1-1-mini",
        "model": "Apodex 1.1 Mini",
        "creator": "Apodex",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/apodex-1-1-mini",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1-mini.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.34,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 82.34,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 2,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 90.8,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 16
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "apodex-1-1-mini-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/apodex-1-1-mini-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-mini-vs-kimi-k3.md",
      "modelA": {
        "slug": "apodex-1-1-mini",
        "canonicalModelKey": "apodex-1-1-mini",
        "model": "Apodex 1.1 Mini",
        "creator": "Apodex",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/apodex-1-1-mini",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1-mini.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 79.92,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 79.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 2,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "apodex-1-1-mini-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/apodex-1-1-mini-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-mini-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "apodex-1-1-mini",
        "canonicalModelKey": "apodex-1-1-mini",
        "model": "Apodex 1.1 Mini",
        "creator": "Apodex",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/apodex-1-1-mini",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1-mini.md"
      },
      "modelB": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 81.69,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 81.69,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 2,
      "benchmarkCountB": 26,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 92,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 64.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 92.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 94.6,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 87.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "apodex-1-1-mini-vs-claude-fable-5-1",
      "url": "https://benchlm.ai/compare/apodex-1-1-mini-vs-claude-fable-5-1",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-mini-vs-claude-fable-5-1.md",
      "modelA": {
        "slug": "apodex-1-1-mini",
        "canonicalModelKey": "apodex-1-1-mini",
        "model": "Apodex 1.1 Mini",
        "creator": "Apodex",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/apodex-1-1-mini",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1-mini.md"
      },
      "modelB": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 0,
      "scoreB": 82.74,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 82.74,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 2,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 81.2,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 65,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "ornith-1-5-35b-a3b-vs-ornith-1-5-397b",
      "url": "https://benchlm.ai/compare/ornith-1-5-35b-a3b-vs-ornith-1-5-397b",
      "markdownUrl": "https://benchlm.ai/md/compare/ornith-1-5-35b-a3b-vs-ornith-1-5-397b.md",
      "modelA": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "modelB": {
        "slug": "ornith-1-5-35b-a3b",
        "canonicalModelKey": "ornith-1-5-35b-a3b",
        "model": "Ornith-1.5-35B-A3B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 47.9,
        "provisionalDisplayScore": 51,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 38.03,
          "upper": 57.77
        },
        "rankingEligible": true,
        "overallRank": 149,
        "url": "https://benchlm.ai/models/ornith-1-5-35b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-35b-a3b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 67.4,
      "scoreB": 47.9,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "scoreDiff": 19.500000000000007,
      "winsA": 3,
      "winsB": 0,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 18,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.6,
          "avgB": 67.6,
          "winner": "A",
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 78,
          "avgB": 71.5,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.1,
          "avgB": 34.2,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "ornith-1-5-397b-vs-ornith-1-5-9b",
      "url": "https://benchlm.ai/compare/ornith-1-5-397b-vs-ornith-1-5-9b",
      "markdownUrl": "https://benchlm.ai/md/compare/ornith-1-5-397b-vs-ornith-1-5-9b.md",
      "modelA": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "modelB": {
        "slug": "ornith-1-5-9b",
        "canonicalModelKey": "ornith-1-5-9b",
        "model": "Ornith-1.5-9B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 37.33,
        "provisionalDisplayScore": 39,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 27.46,
          "upper": 47.2
        },
        "rankingEligible": true,
        "overallRank": 205,
        "url": "https://benchlm.ai/models/ornith-1-5-9b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-9b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 67.4,
      "scoreB": 37.33,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "scoreDiff": 30.070000000000007,
      "winsA": 3,
      "winsB": 0,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 18,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.6,
          "avgB": 56.4,
          "winner": "A",
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 78,
          "avgB": 61.7,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.1,
          "avgB": 29.1,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "ornith-1-0-397b-vs-ornith-1-5-397b",
      "url": "https://benchlm.ai/compare/ornith-1-0-397b-vs-ornith-1-5-397b",
      "markdownUrl": "https://benchlm.ai/md/compare/ornith-1-0-397b-vs-ornith-1-5-397b.md",
      "modelA": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "modelB": {
        "slug": "ornith-1-0-397b",
        "canonicalModelKey": "ornith-1-0-397b",
        "model": "Ornith-1.0-397B",
        "creator": "DeepReinforce AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ornith-1-0-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-0-397b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 67.4,
      "scoreB": 68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "ornith-1-0-397b",
        "canonicalModelKey": "ornith-1-0-397b",
        "model": "Ornith-1.0-397B",
        "creator": "DeepReinforce AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ornith-1-0-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-0-397b.md"
      },
      "scoreDiff": 0.5999999999999943,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.6,
          "avgB": 77.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 78,
          "avgB": 74.6,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-ornith-1-5-397b",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-ornith-1-5-397b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-ornith-1-5-397b.md",
      "modelA": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "modelB": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 67.4,
      "scoreB": 82.34,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 14.939999999999998,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 18,
      "benchmarkCountB": 64,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.6,
          "avgB": 90.8,
          "winner": "B",
          "benchmarkCount": 21
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 78,
          "avgB": 89.5,
          "winner": "B",
          "benchmarkCount": 15
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 66.9,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.1,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "kimi-k3-vs-ornith-1-5-397b",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-ornith-1-5-397b",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-ornith-1-5-397b.md",
      "modelA": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 67.4,
      "scoreB": 79.92,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 12.519999999999996,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.6,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 78,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.1,
          "avgB": 61,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-kimi-k3.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 79.92,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 2.4200000000000017,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 64,
      "benchmarkCountB": 37,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 89.5,
          "winner": null,
          "benchmarkCount": 23
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 18
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 20
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 61,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-fable-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/claude-fable-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-claude-opus-5.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 82.49,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 0.14999999999999147,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 64,
      "benchmarkCountB": 12,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 84.6,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 89.2,
          "winner": "A",
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 57.9,
          "winner": "A",
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-claude-opus-5.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 75.96,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 6.38000000000001,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 64,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 80.3,
          "winner": null,
          "benchmarkCount": 24
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 81.1,
          "winner": "A",
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 77,
          "winner": null,
          "benchmarkCount": 11
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 72.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 53.9,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 78.55,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 3.7900000000000063,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 64,
      "benchmarkCountB": 54,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 28
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 67.7,
          "winner": null,
          "benchmarkCount": 18
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 86.3,
          "winner": null,
          "benchmarkCount": 32
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 78.3,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 50.2,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 82.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 71.27,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 11.070000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 64,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 69.7,
          "winner": null,
          "benchmarkCount": 25
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 77.9,
          "winner": null,
          "benchmarkCount": 17
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 21
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 7
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.1,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 72.5,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 9.840000000000003,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 64,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 87.4,
          "winner": null,
          "benchmarkCount": 22
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 63.4,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 80.7,
          "winner": null,
          "benchmarkCount": 10
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 83.9,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 18
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-claude-sonnet-5",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-claude-sonnet-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-claude-sonnet-5.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 64.72,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 17.620000000000005,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 64,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 76.7,
          "winner": "A",
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 10
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 57.4,
          "winner": "A",
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 65.45,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 16.89,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 64,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 26
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 23
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 21
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 7
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 5.820000000000007,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 64,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 28
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 61.5,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 10
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 62.1,
          "winner": "A",
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 21.340000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 64,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 15
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-gpt-5-5.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 9.659999999999997,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 64,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 27
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 10
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 85,
          "winner": "A",
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 15.409999999999997,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 64,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 22
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 10
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 59.5,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 18
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-glm-5-2.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 19.46,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 64,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 21
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 15
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 9
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-claude-opus-5.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 10.13000000000001,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 64,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 22
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 78.6,
          "winner": "A",
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 75.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 17
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-opus-5-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-opus-5-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-5-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "scoreDiff": 26.130000000000003,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 64,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 22
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 15
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 15
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 77.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 18
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "claude-fable-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-fable-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 82.49,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 2.569999999999993,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 37,
      "benchmarkCountB": 12,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 84.6,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.2,
          "winner": null,
          "benchmarkCount": 15
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 57.9,
          "winner": null,
          "benchmarkCount": 14
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 75.96,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 3.960000000000008,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 80.3,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 81.1,
          "winner": null,
          "benchmarkCount": 17
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 77,
          "winner": null,
          "benchmarkCount": 14
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 72.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 62.7,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 53.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "kimi-k3-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 78.55,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 1.3700000000000045,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 54,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 21
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 67.7,
          "winner": null,
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 86.3,
          "winner": null,
          "benchmarkCount": 28
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 78.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 50.2,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 82.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "kimi-k3-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 71.27,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 8.650000000000006,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 37,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 69.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 77.9,
          "winner": null,
          "benchmarkCount": 17
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-terra-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/gpt-5-6-terra-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-terra-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 72.5,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 7.420000000000002,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 87.4,
          "winner": "A",
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 63.4,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 80.7,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 83.9,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 64.72,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 15.200000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 37,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 76.7,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 57.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "kimi-k3-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 65.45,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 14.469999999999999,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 37,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 17
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 25
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "kimi-k3-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/kimi-k3-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/kimi-k3-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 3.4000000000000057,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 37,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 61.5,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 14
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 18.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 37,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 7.239999999999995,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 57.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-luna-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/gpt-5-6-luna-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-luna-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 12.989999999999995,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 84.1,
          "winner": "A",
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 17.04,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 59.6,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 7.710000000000008,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 13
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 60,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "scoreDiff": 23.71,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 37,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-fable-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-fable-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 82.49,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 0.7999999999999972,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 26,
      "benchmarkCountB": 12,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 84.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 89.2,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 57.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 78.55,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 3.1400000000000006,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 26,
      "benchmarkCountB": 54,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 67.7,
          "winner": "B",
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 86.3,
          "winner": null,
          "benchmarkCount": 25
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 78.3,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 50.2,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 82.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 71.27,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 10.420000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 26,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 69.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 77.9,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 97.1,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 72.5,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 9.189999999999998,
      "winsA": 6,
      "winsB": 0,
      "comparableCategoryCount": 6,
      "benchmarkCountA": 26,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 87.4,
          "winner": "A",
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 63.4,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 80.7,
          "winner": "A",
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 83.9,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 92.9,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 80.8,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 65.45,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 16.239999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 26,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "gpt-5-6-sol-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/gpt-5-6-sol-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-sol-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 5.170000000000002,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 26,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 61.5,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 20.689999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 26,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 9.009999999999991,
      "winsA": 3,
      "winsB": 0,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 26,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 58.6,
          "winner": "A",
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 85,
          "winner": "A",
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 47.6,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-luna-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/gpt-5-6-luna-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-luna-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 14.759999999999991,
      "winsA": 6,
      "winsB": 0,
      "comparableCategoryCount": 6,
      "benchmarkCountA": 26,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 84.1,
          "winner": "A",
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 62.7,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 78.4,
          "winner": "A",
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 59.5,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 92.3,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 73.6,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 18.809999999999995,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 26,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 62.1,
          "winner": "A",
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 9.480000000000004,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 26,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 75.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "scoreDiff": 25.479999999999997,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 26,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": 77.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 31.8,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-claude-opus-4-8",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-claude-opus-4-8",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-claude-opus-4-8.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 75.96,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 6.780000000000001,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 80.3,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 81.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 77,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 72.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 53.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 78.55,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 4.189999999999998,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 54,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 67.7,
          "winner": "A",
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 86.3,
          "winner": null,
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 78.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 50.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 82.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 71.27,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 11.469999999999999,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 18,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 69.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 77.9,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 72.5,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 10.239999999999995,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 18,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 87.4,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 63.4,
          "winner": "A",
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 80.7,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 83.9,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-claude-sonnet-5",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-claude-sonnet-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-claude-sonnet-5.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 64.72,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 18.019999999999996,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 76.7,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 57.4,
          "winner": "A",
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 65.45,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 17.289999999999992,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 18,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 15
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 76.52,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 6.219999999999999,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 18,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 61.5,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 62.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 61,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 21.739999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 18,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-gpt-5-5.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 72.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 10.059999999999988,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 18,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 58.6,
          "winner": "A",
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 85,
          "winner": "A",
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 66.93,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 15.809999999999988,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 18,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 62.7,
          "winner": "A",
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 59.5,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-glm-5-2.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 62.88,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 19.859999999999992,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 62.1,
          "winner": "A",
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-claude-opus-4-7-adaptive",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-claude-opus-4-7-adaptive",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-claude-opus-4-7-adaptive.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 72.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 10.530000000000001,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 75.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "scoreDiff": 26.529999999999994,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 18,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": 77.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-fable-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/claude-fable-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 78.55,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 3.9399999999999977,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 54,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 67.7,
          "winner": null,
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 86.3,
          "winner": null,
          "benchmarkCount": 26
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 78.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 50.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 82.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/claude-fable-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 71.27,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 11.219999999999999,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 69.7,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 77.9,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/claude-fable-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 72.5,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 9.989999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 87.4,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 63.4,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 80.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 83.9,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-vs-claude-sonnet-5",
      "url": "https://benchlm.ai/compare/claude-fable-vs-claude-sonnet-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-claude-sonnet-5.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 64.72,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 17.769999999999996,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 12,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 76.7,
          "winner": "A",
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 57.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/claude-fable-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 65.45,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 17.039999999999992,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 12,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 71.7,
          "winner": "A",
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/claude-fable-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 5.969999999999999,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 12,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 80.4,
          "winner": "A",
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 61.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-fable-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 21.489999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-fable-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/claude-fable-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 15.559999999999988,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-fable-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/claude-fable-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-glm-5-2.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 19.609999999999992,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-fable-vs-claude-opus-4-7-adaptive",
      "url": "https://benchlm.ai/compare/claude-fable-vs-claude-opus-4-7-adaptive",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-claude-opus-4-7-adaptive.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 10.280000000000001,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 12,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 78.6,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-fable-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-fable-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "scoreDiff": 26.279999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 78.55,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 2.5900000000000034,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 33,
      "benchmarkCountB": 54,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 23
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 67.7,
          "winner": null,
          "benchmarkCount": 16
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 86.3,
          "winner": null,
          "benchmarkCount": 25
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 78.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 50.2,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 82.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 71.27,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 4.689999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 69.7,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 77.9,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 97.1,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 72.5,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 3.4599999999999937,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 33,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 87.4,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 63.4,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 80.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 83.9,
          "winner": "B",
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 65.45,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 10.509999999999991,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 0.5600000000000023,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 61.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 14.959999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 33,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 9.029999999999987,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 33,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 59.5,
          "winner": "A",
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-glm-5-2.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 13.079999999999991,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 33,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 59.6,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "claude-opus-4-8-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-opus-4-8-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-8-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "scoreDiff": 19.749999999999993,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 33,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": 77.1,
          "winner": "B",
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "qwen3-7-max-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/qwen3-7-max-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-7-max-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 71.27,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 7.280000000000001,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 54,
      "benchmarkCountB": 36,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 69.7,
          "winner": null,
          "benchmarkCount": 22
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 77.9,
          "winner": null,
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": 90.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": 84.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-terra-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/gpt-5-6-terra-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-terra-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 72.5,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 6.049999999999997,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 54,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 87.4,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 63.4,
          "winner": "A",
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 80.7,
          "winner": null,
          "benchmarkCount": 25
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": 83.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 64.72,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 13.829999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 54,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 76.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 57.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "qwen3-7-plus-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/qwen3-7-plus-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-7-plus-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 65.45,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 13.099999999999994,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 54,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 21
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 14
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 81.5,
          "winner": "A",
          "benchmarkCount": 26
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "muse-spark-1-1-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/muse-spark-1-1-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/muse-spark-1-1-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 2.030000000000001,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 54,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 23
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 61.5,
          "winner": "A",
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 17.549999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 54,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 5.86999999999999,
      "winsA": 1,
      "winsB": 1,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 54,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 23
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 58.6,
          "winner": "A",
          "benchmarkCount": 15
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 26
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 6
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 57.8,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-luna-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/gpt-5-6-luna-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-luna-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 11.61999999999999,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 54,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 62.7,
          "winner": "A",
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 25
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 15.669999999999995,
      "winsA": 1,
      "winsB": 1,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 54,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 62.1,
          "winner": "A",
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 59.6,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 6.340000000000003,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 54,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 25
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 60,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "scoreDiff": 22.339999999999996,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 54,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 82.6,
          "winner": "A",
          "benchmarkCount": 24
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gpt-5-6-terra-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/gpt-5-6-terra-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-terra-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 72.5,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 1.230000000000004,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 87.4,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 63.4,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 80.7,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 83.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 64.72,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "scoreDiff": 6.549999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 76.7,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 57.4,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "qwen3-7-max-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/qwen3-7-max-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/qwen3-7-max-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 65.45,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "scoreDiff": 5.819999999999993,
      "winsA": 4,
      "winsB": 2,
      "comparableCategoryCount": 6,
      "benchmarkCountA": 36,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 75.6,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 15
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 91.7,
          "winner": "B",
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 60.1,
          "winner": "A",
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": 84.5,
          "winner": "B",
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": 85.4,
          "winner": "A",
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 92.9,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "muse-spark-1-1-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/muse-spark-1-1-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/muse-spark-1-1-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 5.25,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 20
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 61.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "scoreDiff": 10.269999999999996,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 1.4100000000000108,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 6
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "gpt-5-6-luna-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/gpt-5-6-luna-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-luna-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "scoreDiff": 4.339999999999989,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "glm-5-2-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "scoreDiff": 8.389999999999993,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 36,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 81,
          "winner": "B",
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "scoreDiff": 0.9399999999999977,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "scoreDiff": 15.059999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 64.72,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 7.780000000000001,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 81.9,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 76.7,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 88.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 57.4,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-terra-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/gpt-5-6-terra-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-terra-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 65.45,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 7.049999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "gpt-5-6-terra-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/gpt-5-6-terra-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-terra-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 76.52,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 4.019999999999996,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 24,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 61.5,
          "winner": "A",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 61,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 11.5,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 72.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 0.18000000000000682,
      "winsA": 2,
      "winsB": 1,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 24,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 58.6,
          "winner": "A",
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": 85,
          "winner": "B",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": 47.6,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-luna-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/gpt-5-6-luna-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-luna-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 66.93,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 5.569999999999993,
      "winsA": 6,
      "winsB": 0,
      "comparableCategoryCount": 6,
      "benchmarkCountA": 24,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 84.1,
          "winner": "A",
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 62.7,
          "winner": "A",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 78.4,
          "winner": "A",
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": 59.5,
          "winner": "A",
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 92.3,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": 73.6,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 62.88,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 9.619999999999997,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 24,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 62.1,
          "winner": "A",
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 72.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 0.29000000000000625,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 24,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": 75.8,
          "winner": "A",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "scoreDiff": 16.29,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 24,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": 77.1,
          "winner": "A",
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": 31.8,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 65.45,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "scoreDiff": 0.730000000000004,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 16,
      "benchmarkCountB": 51,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 71.7,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 75.6,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 91.7,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 60.1,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 84.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 85.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 92.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 76.52,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 11.799999999999997,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 16,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 61.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 88.4,
          "winner": "B",
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 62.1,
          "winner": "B",
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 61,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "scoreDiff": 3.719999999999999,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 16,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-gpt-5-5.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 72.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 7.960000000000008,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 16,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 81.6,
          "winner": "A",
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 66.93,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "scoreDiff": 2.210000000000008,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 16,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-glm-5-2.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 62.88,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "scoreDiff": 1.8399999999999963,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 16,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-claude-sonnet-5",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-claude-sonnet-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-claude-sonnet-5.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 72.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "scoreDiff": 7.489999999999995,
      "winsA": 1,
      "winsB": 1,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 16,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 75.1,
          "winner": "A",
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 78.6,
          "winner": "B",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-sonnet-5-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-sonnet-5-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-sonnet-5-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "scoreDiff": 8.509999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 16,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "muse-spark-1-1-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/muse-spark-1-1-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/muse-spark-1-1-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 76.52,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "supported",
      "overallWinner": "B",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 11.069999999999993,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 51,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": 80.4,
          "winner": "B",
          "benchmarkCount": 19
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": 61.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": 88.4,
          "winner": null,
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "scoreDiff": 4.450000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 51,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 15
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 7.230000000000004,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 51,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 18
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 6
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "gpt-5-6-luna-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/gpt-5-6-luna-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-luna-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "scoreDiff": 1.480000000000004,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 51,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "glm-5-2-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "scoreDiff": 2.5700000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 51,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 15
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "scoreDiff": 6.759999999999991,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 51,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "scoreDiff": 9.240000000000002,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 51,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": 82.6,
          "winner": "B",
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "modelB": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 76.52,
      "scoreB": 61,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 15.519999999999996,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 21,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 76.52,
      "scoreB": 72.68,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 3.839999999999989,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 21,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.4,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.5,
          "avgB": 58.6,
          "winner": "A",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.4,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 5
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.1,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gpt-5-6-luna-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/gpt-5-6-luna-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-6-luna-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 76.52,
      "scoreB": 66.93,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 9.58999999999999,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 21,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.4,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.5,
          "avgB": 62.7,
          "winner": "B",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.4,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.1,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 76.52,
      "scoreB": 62.88,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 13.639999999999993,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 21,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.4,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.5,
          "avgB": 62.1,
          "winner": "B",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.1,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 76.52,
      "scoreB": 72.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 4.310000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 21,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.4,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.5,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.4,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.1,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 76.52,
      "scoreB": 56.21,
      "evidenceStatusA": "supported",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "scoreDiff": 20.309999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 21,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.4,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-gpt-5-5",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-gpt-5-5",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-gpt-5-5.md",
      "modelA": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "modelB": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61,
      "scoreB": 72.68,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 11.680000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 33,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81.6,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 58.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 70.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 85,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 57.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61,
      "scoreB": 66.93,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "scoreDiff": 5.930000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 62.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 59.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-7-flash-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/gemini-3-7-flash-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-7-flash-vs-glm-5-2.md",
      "modelA": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61,
      "scoreB": 62.88,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "scoreDiff": 1.8800000000000026,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 62.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61,
      "scoreB": 72.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "scoreDiff": 11.209999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "scoreDiff": 4.789999999999999,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "gpt-5-5-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/gpt-5-5-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/gpt-5-5-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "modelB": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.68,
      "scoreB": 66.93,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-5",
        "canonicalModelKey": "gpt-5-5",
        "model": "GPT-5.5",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.68,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 64.14,
          "upper": 81.23
        },
        "rankingEligible": true,
        "overallRank": 13,
        "url": "https://benchlm.ai/models/gpt-5-5",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-5.md"
      },
      "scoreDiff": 5.75,
      "winsA": 1,
      "winsB": 2,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 33,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.6,
          "avgB": 84.1,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.6,
          "avgB": 62.7,
          "winner": "B",
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 70.4,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 85,
          "avgB": 59.5,
          "winner": "A",
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.8,
          "avgB": 92.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 47.6,
          "avgB": 73.6,
          "winner": "B",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "glm-5-2-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/glm-5-2-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/glm-5-2-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "modelB": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.93,
      "scoreB": 62.88,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "scoreDiff": 4.050000000000004,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 24,
      "benchmarkCountB": 20,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.1,
          "avgB": 81,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.7,
          "avgB": 62.1,
          "winner": "A",
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 59.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.3,
          "avgB": 59.6,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 73.6,
          "avgB": 95.9,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.93,
      "scoreB": 72.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "scoreDiff": 5.279999999999987,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 24,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.1,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.7,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.4,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 59.5,
          "avgB": 75.8,
          "winner": "B",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.3,
          "avgB": 60,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 73.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.93,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "scoreDiff": 10.720000000000006,
      "winsA": 1,
      "winsB": 1,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 24,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.4,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 59.5,
          "avgB": 77.1,
          "winner": "B",
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 73.6,
          "avgB": 31.8,
          "winner": "A",
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-glm-5-2.md",
      "modelA": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "modelB": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 62.88,
      "scoreB": 72.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "B",
      "winner": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "scoreDiff": 9.329999999999991,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 20,
      "benchmarkCountB": 21,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81,
          "avgB": 75.1,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.1,
          "avgB": 78.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 65.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 59.6,
          "avgB": 60,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 95.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "gemini-3-1-pro-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/gemini-3-1-pro-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/gemini-3-1-pro-vs-glm-5-2.md",
      "modelA": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 62.88,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "scoreDiff": 6.670000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 20,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 77.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 59.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 95.9,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-opus-4-7-adaptive-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-opus-4-7-adaptive-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-opus-4-7-adaptive-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "modelB": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.21,
      "scoreB": 56.21,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "scoreDiff": 15.999999999999993,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 21,
      "benchmarkCountB": 23,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 75.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 78.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 65.1,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 75.8,
          "avgB": 77.1,
          "winner": "B",
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 31.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-opus-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-opus-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-opus-5.md",
      "modelA": {
        "slug": "claude-opus-5",
        "canonicalModelKey": "claude-opus-5",
        "model": "Claude Opus 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 82.34,
        "provisionalDisplayScore": 84,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 79.1,
          "upper": 85.59
        },
        "rankingEligible": true,
        "overallRank": 3,
        "url": "https://benchlm.ai/models/claude-opus-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-5.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.34,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 3.6599999999999966,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 64,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 90.8,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 21
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.5,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.9,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 11
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.7,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 16
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-kimi-k3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-kimi-k3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-kimi-k3.md",
      "modelA": {
        "slug": "kimi-k3",
        "canonicalModelKey": "kimi-3",
        "model": "Kimi K3",
        "creator": "Moonshot AI",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 79.92,
        "provisionalDisplayScore": 82,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 77.66,
          "upper": 82.19
        },
        "rankingEligible": true,
        "overallRank": 5,
        "url": "https://benchlm.ai/models/kimi-k3",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k3.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 79.92,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 6.079999999999998,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 37,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 89.5,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 14
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 61,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-6-sol",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-6-sol",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-6-sol.md",
      "modelA": {
        "slug": "gpt-5-6-sol",
        "canonicalModelKey": "gpt-5-6-sol",
        "model": "GPT-5.6 Sol",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 81.69,
        "provisionalDisplayScore": 80,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 78.87,
          "upper": 84.5
        },
        "rankingEligible": true,
        "overallRank": 4,
        "url": "https://benchlm.ai/models/gpt-5-6-sol",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-sol.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 81.69,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 4.310000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 26,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 92,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.6,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 92.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 94.6,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 87.5,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-fable-5-1-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/claude-fable-5-1-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-5-1-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-fable-5-1",
        "canonicalModelKey": "claude-fable-5-1",
        "model": "Claude Fable 5.1",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 82.74,
        "provisionalDisplayScore": 79,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 71.23,
          "upper": 94.26
        },
        "rankingEligible": true,
        "overallRank": 1,
        "url": "https://benchlm.ai/models/claude-fable-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable-5-1.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.74,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 3.260000000000005,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 18,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.2,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 65,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-fable-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/claude-fable-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-fable-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-fable",
        "canonicalModelKey": "claude-fable-5",
        "model": "Claude Fable 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": 82.49,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 80.26,
          "upper": 84.73
        },
        "rankingEligible": true,
        "overallRank": 2,
        "url": "https://benchlm.ai/models/claude-fable",
        "markdownUrl": "https://benchlm.ai/md/models/claude-fable.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 82.49,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 3.510000000000005,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 12,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.6,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.2,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 57.9,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-opus-4-8",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-opus-4-8",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-opus-4-8.md",
      "modelA": {
        "slug": "claude-opus-4-8",
        "canonicalModelKey": "claude-opus-4-8",
        "model": "Claude Opus 4.8",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.96,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 73.5,
          "upper": 78.43
        },
        "rankingEligible": true,
        "overallRank": 9,
        "url": "https://benchlm.ai/models/claude-opus-4-8",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-8.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 75.96,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 10.040000000000006,
      "winsA": 0,
      "winsB": 3,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 33,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.3,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 81.1,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 72.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.7,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 53.9,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-8-max",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-8-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-8-max.md",
      "modelA": {
        "slug": "qwen3-8-max",
        "canonicalModelKey": "qwen3-8-max",
        "model": "Qwen3.8 Max",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.55,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 76.4,
          "upper": 80.7
        },
        "rankingEligible": true,
        "overallRank": 6,
        "url": "https://benchlm.ai/models/qwen3-8-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-max.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 78.55,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 7.450000000000003,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 54,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 86.1,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 17
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 67.7,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 86.3,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 25
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 78.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 50.2,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-7-max",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-7-max",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-7-max.md",
      "modelA": {
        "slug": "qwen3-7-max",
        "canonicalModelKey": "qwen3-7-max",
        "model": "Qwen3.7 Max",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 71.27,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 63.59,
          "upper": 78.94
        },
        "rankingEligible": true,
        "overallRank": 18,
        "url": "https://benchlm.ai/models/qwen3-7-max",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-max.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 71.27,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 14.730000000000004,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.7,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.9,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 90.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 64.2,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-6-terra",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-6-terra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-6-terra.md",
      "modelA": {
        "slug": "gpt-5-6-terra",
        "canonicalModelKey": "gpt-5-6-terra",
        "model": "GPT-5.6 Terra",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 72.5,
        "provisionalDisplayScore": 76,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 63.24,
          "upper": 81.76
        },
        "rankingEligible": true,
        "overallRank": 14,
        "url": "https://benchlm.ai/models/gpt-5-6-terra",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-terra.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.5,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 13.5,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87.4,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 63.4,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.7,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 83.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.9,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 80.8,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-sonnet-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-sonnet-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-sonnet-5.md",
      "modelA": {
        "slug": "claude-sonnet-5",
        "canonicalModelKey": "claude-sonnet-5",
        "model": "Claude Sonnet 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.72,
        "provisionalDisplayScore": 75,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.18,
          "upper": 78.26
        },
        "rankingEligible": true,
        "overallRank": 39,
        "url": "https://benchlm.ai/models/claude-sonnet-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-5.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.72,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 21.28,
      "winsA": 0,
      "winsB": 3,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 16,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81.9,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 76.7,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.3,
          "avgB": 93.5,
          "winner": "B",
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.4,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-7-plus",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-7-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-7-plus.md",
      "modelA": {
        "slug": "qwen3-7-plus",
        "canonicalModelKey": "qwen3-7-plus",
        "model": "Qwen3.7 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.45,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.69,
          "upper": 76.21
        },
        "rankingEligible": true,
        "overallRank": 36,
        "url": "https://benchlm.ai/models/qwen3-7-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-7-plus.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.45,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 20.549999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 51,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 71.7,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.6,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.5,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 91.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60.1,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 84.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-muse-spark-1-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-muse-spark-1-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-muse-spark-1-1.md",
      "modelA": {
        "slug": "muse-spark-1-1",
        "canonicalModelKey": "muse-spark-1-1",
        "model": "Muse Spark 1.1",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 76.52,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 71.9,
          "upper": 81.14
        },
        "rankingEligible": true,
        "overallRank": 8,
        "url": "https://benchlm.ai/models/muse-spark-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-1.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 76.52,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 9.480000000000004,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 21,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 80.4,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.5,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 88.4,
          "avgB": 93.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.1,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-7-flash.md",
      "modelA": {
        "slug": "gemini-3-7-flash",
        "canonicalModelKey": "gemini-3-7-flash",
        "model": "Gemini 3.7 Flash",
        "creator": "Google",
        "sourceType": "Pending",
        "reasoningType": "Reasoning",
        "contextWindow": null,
        "contextWindowTokens": 0,
        "displayScore": 61,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.48,
          "upper": 72.51
        },
        "rankingEligible": true,
        "overallRank": 63,
        "url": "https://benchlm.ai/models/gemini-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-7-flash.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 0,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-6-luna",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-6-luna",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-6-luna.md",
      "modelA": {
        "slug": "gpt-5-6-luna",
        "canonicalModelKey": "gpt-5-6-luna",
        "model": "GPT-5.6 Luna",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 66.93,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.29,
          "upper": 76.58
        },
        "rankingEligible": true,
        "overallRank": 28,
        "url": "https://benchlm.ai/models/gpt-5-6-luna",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-6-luna.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.93,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 19.069999999999993,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 24,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 84.1,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.7,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.4,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 59.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.3,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 73.6,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-5-2",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-5-2.md",
      "modelA": {
        "slug": "glm-5-2",
        "canonicalModelKey": "glm-5-2",
        "model": "GLM-5.2",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.88,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.66,
          "upper": 77.1
        },
        "rankingEligible": true,
        "overallRank": 48,
        "url": "https://benchlm.ai/models/glm-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-2.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 62.88,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 23.119999999999997,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 20,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 81,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.1,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 59.6,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 95.9,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-opus-4-7-adaptive",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-opus-4-7-adaptive",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-opus-4-7-adaptive.md",
      "modelA": {
        "slug": "claude-opus-4-7-adaptive",
        "canonicalModelKey": "claude-opus-4-7-max",
        "model": "Claude Opus 4.7 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 72.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 62.34,
          "upper": 82.07
        },
        "rankingEligible": true,
        "overallRank": 16,
        "url": "https://benchlm.ai/models/claude-opus-4-7-adaptive",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-7-adaptive.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 72.21,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 13.790000000000006,
      "winsA": 0,
      "winsB": 3,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 21,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 75.1,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 78.6,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 65.1,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 75.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 60,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-1-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-1-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-1-pro.md",
      "modelA": {
        "slug": "gemini-3-1-pro",
        "canonicalModelKey": "gemini-3-1-pro",
        "model": "Gemini 3.1 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.21,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.17,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 98,
        "url": "https://benchlm.ai/models/gemini-3-1-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-pro.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.21,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29.79,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 23,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 82.6,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 77.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 31.8,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-muse-spark-1-2",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-muse-spark-1-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-muse-spark-1-2.md",
      "modelA": {
        "slug": "muse-spark-1-2",
        "canonicalModelKey": "muse-spark-1-2",
        "model": "Muse Spark 1.2",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.29,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.78,
          "upper": 72.81
        },
        "rankingEligible": true,
        "overallRank": 55,
        "url": "https://benchlm.ai/models/muse-spark-1-2",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark-1-2.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61.29,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 24.71,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 3,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-5-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-5-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-5-flash.md",
      "modelA": {
        "slug": "gemini-3-5-flash",
        "canonicalModelKey": "gemini-3-5-flash",
        "model": "Gemini 3.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.2,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 54.19,
          "upper": 74.21
        },
        "rankingEligible": true,
        "overallRank": 43,
        "url": "https://benchlm.ai/models/gemini-3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.2,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 21.799999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 22,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 77.2,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 55.1,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 83.8,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 74.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 40.2,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 32.9,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-opus-4-6",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-opus-4-6",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-opus-4-6.md",
      "modelA": {
        "slug": "claude-opus-4-6",
        "canonicalModelKey": "claude-opus-4-6",
        "model": "Claude Opus 4.6",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 67.89,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 53.87,
          "upper": 81.9
        },
        "rankingEligible": true,
        "overallRank": 23,
        "url": "https://benchlm.ai/models/claude-opus-4-6",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-6.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 67.89,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 18.11,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 33,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 73,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 68.1,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77.3,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 69.1,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 9
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 36.3,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-deepseek-v4-pro-0813",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-deepseek-v4-pro-0813",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-deepseek-v4-pro-0813.md",
      "modelA": {
        "slug": "deepseek-v4-pro-0813",
        "canonicalModelKey": "deepseek-v4-pro-max",
        "model": "DeepSeek V4 Pro 0813",
        "creator": "DeepSeek",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.22,
        "provisionalDisplayScore": 64,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.35,
          "upper": 71.09
        },
        "rankingEligible": true,
        "overallRank": 57,
        "url": "https://benchlm.ai/models/deepseek-v4-pro-0813",
        "markdownUrl": "https://benchlm.ai/md/models/deepseek-v4-pro-0813.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 61.22,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 24.78,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 34,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 74.5,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 70.9,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 12
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 62.5,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 95.2,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-4",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-4",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-4.md",
      "modelA": {
        "slug": "gpt-5-4",
        "canonicalModelKey": "gpt-5-4",
        "model": "GPT-5.4",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 73.04,
        "provisionalDisplayScore": 64,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 69.63,
          "upper": 76.45
        },
        "rankingEligible": true,
        "overallRank": 12,
        "url": "https://benchlm.ai/models/gpt-5-4",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-4.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 73.04,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 12.959999999999994,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 37,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 77.2,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 57.7,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 73.2,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 11
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 74,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.6,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 42.5,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-kimi-2-6",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-kimi-2-6",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-kimi-2-6.md",
      "modelA": {
        "slug": "kimi-2-6",
        "canonicalModelKey": "kimi-2-6",
        "model": "Kimi K2.6",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 59.09,
        "provisionalDisplayScore": 62,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.22,
          "upper": 68.96
        },
        "rankingEligible": true,
        "overallRank": 81,
        "url": "https://benchlm.ai/models/kimi-2-6",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-2-6.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 59.09,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.909999999999997,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 32,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 73.5,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.4,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 79.8,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 42.2,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 67.1,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-5-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-5-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-5-1.md",
      "modelA": {
        "slug": "glm-5-1",
        "canonicalModelKey": "glm-5-1",
        "model": "GLM-5.1",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "203K",
        "contextWindowTokens": 203000,
        "displayScore": 66.68,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.9,
          "upper": 77.46
        },
        "rankingEligible": true,
        "overallRank": 29,
        "url": "https://benchlm.ai/models/glm-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-1.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.68,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 19.319999999999993,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 21,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 65.4,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 61.3,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 52.3,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 62,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 7
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-sonnet-4-6",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-sonnet-4-6",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-sonnet-4-6.md",
      "modelA": {
        "slug": "claude-sonnet-4-6",
        "canonicalModelKey": "claude-sonnet-4-6",
        "model": "Claude Sonnet 4.6",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 64.47,
        "provisionalDisplayScore": 60,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 51.06,
          "upper": 77.88
        },
        "rankingEligible": true,
        "overallRank": 41,
        "url": "https://benchlm.ai/models/claude-sonnet-4-6",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-4-6.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.47,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 21.53,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 20,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 65.2,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 69.1,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77.4,
          "avgB": 93.5,
          "winner": "B",
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 66,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 26.4,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-inkling",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-inkling",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-inkling.md",
      "modelA": {
        "slug": "inkling",
        "canonicalModelKey": "inkling",
        "model": "Inkling",
        "creator": "Thinking Machines Lab",
        "sourceType": "Open Weight",
        "reasoningType": "Hybrid",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 66.51,
        "provisionalDisplayScore": 58,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 59.05,
          "upper": 73.97
        },
        "rankingEligible": true,
        "overallRank": 31,
        "url": "https://benchlm.ai/models/inkling",
        "markdownUrl": "https://benchlm.ai/md/models/inkling.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.51,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 19.489999999999995,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 15,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 69.4,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 68.6,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.5,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.6,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 79.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.1,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-minimax-m3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-minimax-m3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-minimax-m3.md",
      "modelA": {
        "slug": "minimax-m3",
        "canonicalModelKey": "minimax-m3",
        "model": "MiniMax M3",
        "creator": "MiniMax",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 68.17,
        "provisionalDisplayScore": 58,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 62.45,
          "upper": 73.89
        },
        "rankingEligible": true,
        "overallRank": 22,
        "url": "https://benchlm.ai/models/minimax-m3",
        "markdownUrl": "https://benchlm.ai/md/models/minimax-m3.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 68.17,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 17.83,
      "winsA": 0,
      "winsB": 3,
      "comparableCategoryCount": 3,
      "benchmarkCountA": 22,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 72.3,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 72.2,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 64.9,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 85.7,
          "avgB": 97.6,
          "winner": "B",
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-6-plus",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-6-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-6-plus.md",
      "modelA": {
        "slug": "qwen3-6-plus",
        "canonicalModelKey": "qwen3-6-plus",
        "model": "Qwen3.6 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 64.56,
        "provisionalDisplayScore": 58,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.9,
          "upper": 74.23
        },
        "rankingEligible": true,
        "overallRank": 40,
        "url": "https://benchlm.ai/models/qwen3-6-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-plus.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 64.56,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 21.439999999999998,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 43,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 61.6,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 70.3,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 79.8,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 62,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 57.1,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 84.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 60.5,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-inkling-small",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-inkling-small",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-inkling-small.md",
      "modelA": {
        "slug": "inkling-small",
        "canonicalModelKey": "inkling-small",
        "model": "Inkling-Small",
        "creator": "Thinking Machines Lab",
        "sourceType": "Open Weight",
        "reasoningType": "Hybrid",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 63.52,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 57.93,
          "upper": 69.12
        },
        "rankingEligible": true,
        "overallRank": 45,
        "url": "https://benchlm.ai/models/inkling-small",
        "markdownUrl": "https://benchlm.ai/md/models/inkling-small.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 63.52,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 22.479999999999997,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 20,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 70.1,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 62.4,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.6,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 40.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 53.4,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 82.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 92.9,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-5.md",
      "modelA": {
        "slug": "glm-5",
        "canonicalModelKey": "glm-5",
        "model": "GLM-5",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 65.49,
        "provisionalDisplayScore": 56,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 53.78,
          "upper": 77.2
        },
        "rankingEligible": true,
        "overallRank": 35,
        "url": "https://benchlm.ai/models/glm-5",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 65.49,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 20.510000000000005,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 36,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 56.2,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 13
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 66.3,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 60.8,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 66.4,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 92.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 83.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 56.3,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 9
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-4-mini",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-4-mini",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-4-mini.md",
      "modelA": {
        "slug": "gpt-5-4-mini",
        "canonicalModelKey": "gpt-5-4-mini",
        "model": "GPT-5.4 mini",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "400K",
        "contextWindowTokens": 400000,
        "displayScore": 56.69,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 45.17,
          "upper": 68.2
        },
        "rankingEligible": true,
        "overallRank": 96,
        "url": "https://benchlm.ai/models/gpt-5-4-mini",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-4-mini.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.69,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29.310000000000002,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 14,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 65.7,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.6,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 47.8,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 21.7,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-opus-4-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-opus-4-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-opus-4-5.md",
      "modelA": {
        "slug": "claude-opus-4-5",
        "canonicalModelKey": "claude-opus-4-5",
        "model": "Claude Opus 4.5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 63.51,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 49.13,
          "upper": 77.89
        },
        "rankingEligible": true,
        "overallRank": 46,
        "url": "https://benchlm.ai/models/claude-opus-4-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-5.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 63.51,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 22.490000000000002,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 45,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 62.6,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 71.7,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 69.9,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 64.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 58.1,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 69.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 85.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 57.5,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 8
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-5-397b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-5-397b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-5-397b.md",
      "modelA": {
        "slug": "qwen3-5-397b",
        "canonicalModelKey": "qwen3-5-397b",
        "model": "Qwen3.5 397B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 57.75,
        "provisionalDisplayScore": 54,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 46.24,
          "upper": 69.27
        },
        "rankingEligible": true,
        "overallRank": 89,
        "url": "https://benchlm.ai/models/qwen3-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-397b.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 57.75,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 28.25,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 38,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 56.5,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 15
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 66.5,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 79.6,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 63.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 56.6,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 92.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 84.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 90.6,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-muse-glimmer-30b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-muse-glimmer-30b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-muse-glimmer-30b.md",
      "modelA": {
        "slug": "muse-glimmer-30b",
        "canonicalModelKey": "muse-glimmer-30b",
        "model": "Muse Glimmer 30B",
        "creator": "Meta",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "131K",
        "contextWindowTokens": 131000,
        "displayScore": null,
        "provisionalDisplayScore": 54,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/muse-glimmer-30b",
        "markdownUrl": "https://benchlm.ai/md/models/muse-glimmer-30b.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 54,
      "scoreB": 86,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 32,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 14,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 65.9,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 57.8,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 75.7,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 77,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 94.7,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mai-thinking-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mai-thinking-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mai-thinking-1.md",
      "modelA": {
        "slug": "mai-thinking-1",
        "canonicalModelKey": "mai-thinking-1",
        "model": "MAI-Thinking-1",
        "creator": "Microsoft",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 50.52,
        "provisionalDisplayScore": 54,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 40.65,
          "upper": 60.39
        },
        "rankingEligible": true,
        "overallRank": 135,
        "url": "https://benchlm.ai/models/mai-thinking-1",
        "markdownUrl": "https://benchlm.ai/md/models/mai-thinking-1.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 50.52,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 35.48,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 14,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 46,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 65.5,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 72.5,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 85,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 89.7,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-pro.md",
      "modelA": {
        "slug": "gemini-3-pro",
        "canonicalModelKey": "gemini-3-pro",
        "model": "Gemini 3 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "2M",
        "contextWindowTokens": 2000000,
        "displayScore": 67.25,
        "provisionalDisplayScore": 53,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.19,
          "upper": 79.3
        },
        "rankingEligible": true,
        "overallRank": 26,
        "url": "https://benchlm.ai/models/gemini-3-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-pro.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 67.25,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 18.75,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 12,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": null,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 81.1,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 8
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 31.1,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": null,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 32.9,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-2",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-2.md",
      "modelA": {
        "slug": "gpt-5-2",
        "canonicalModelKey": "gpt-5-2",
        "model": "GPT-5.2",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "400K",
        "contextWindowTokens": 400000,
        "displayScore": 57.95,
        "provisionalDisplayScore": 52,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.94,
          "upper": 65.96
        },
        "rankingEligible": true,
        "overallRank": 87,
        "url": "https://benchlm.ai/models/gpt-5-2",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-2.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 57.95,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 28.049999999999997,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 55.7,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 70.6,
          "avgB": 89.7,
          "winner": "B",
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 80.4,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 52.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 92.4,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 35.2,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-6-27b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-6-27b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-6-27b.md",
      "modelA": {
        "slug": "qwen3-6-27b",
        "canonicalModelKey": "qwen3-6-27b",
        "model": "Qwen3.6-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.57,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.05,
          "upper": 65.08
        },
        "rankingEligible": true,
        "overallRank": 113,
        "url": "https://benchlm.ai/models/qwen3-6-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-27b.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 53.57,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 32.43,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 38,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 59.3,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 77.5,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.7,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 17
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 53.3,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 89.2,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ling-3-0-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ling-3-0-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ling-3-0-flash.md",
      "modelA": {
        "slug": "ling-3-0-flash",
        "canonicalModelKey": "ling-3-0-flash",
        "model": "Ling 3.0 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 53.62,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.1,
          "upper": 65.13
        },
        "rankingEligible": true,
        "overallRank": 112,
        "url": "https://benchlm.ai/models/ling-3-0-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 53.62,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 32.38,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 17,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 72.2,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 47.1,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 31.1,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 74.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 90.1,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-kimi-k2-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-kimi-k2-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-kimi-k2-5.md",
      "modelA": {
        "slug": "kimi-k2-5",
        "canonicalModelKey": "kimi-k2-5",
        "model": "Kimi K2.5",
        "creator": "Moonshot AI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 58.74,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 50.13,
          "upper": 67.34
        },
        "rankingEligible": true,
        "overallRank": 84,
        "url": "https://benchlm.ai/models/kimi-k2-5",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-5.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 58.74,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 27.259999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 45,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 55,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 59.4,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 9
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 78.5,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 61,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 56.9,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 93.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 82.3,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 60.6,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 10
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-nemotron-3-ultra",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-nemotron-3-ultra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-nemotron-3-ultra.md",
      "modelA": {
        "slug": "nemotron-3-ultra",
        "canonicalModelKey": "nemotron-3-ultra-500b",
        "model": "Nemotron 3 Ultra",
        "creator": "NVIDIA",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 45.68,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 35.81,
          "upper": 55.55
        },
        "rankingEligible": true,
        "overallRank": 164,
        "url": "https://benchlm.ai/models/nemotron-3-ultra",
        "markdownUrl": "https://benchlm.ai/md/models/nemotron-3-ultra.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 45.68,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 40.32,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 19,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 51.3,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 58.3,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 61.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 53.8,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 81.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 83,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-5-27b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-5-27b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-5-27b.md",
      "modelA": {
        "slug": "qwen3-5-27b",
        "canonicalModelKey": "qwen3-5-27b",
        "model": "Qwen3.5-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 59.7,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 49.77,
          "upper": 69.63
        },
        "rankingEligible": true,
        "overallRank": 74,
        "url": "https://benchlm.ai/models/qwen3-5-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-27b.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 59.7,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.299999999999997,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 16,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 52,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 64.9,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 60.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 82.7,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 95,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 82.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-5-122b-a10b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-5-122b-a10b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-5-122b-a10b.md",
      "modelA": {
        "slug": "qwen3-5-122b-a10b",
        "canonicalModelKey": "qwen3-5-122b-a10b",
        "model": "Qwen3.5-122B-A10B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 59.49,
        "provisionalDisplayScore": 47,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 47.64,
          "upper": 71.34
        },
        "rankingEligible": true,
        "overallRank": 77,
        "url": "https://benchlm.ai/models/qwen3-5-122b-a10b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-122b-a10b.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 59.49,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.509999999999998,
      "winsA": 0,
      "winsB": 2,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 15,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 56.4,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 72,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 77.2,
          "avgB": 93.5,
          "winner": "B",
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 60.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 83.6,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 93.4,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 82.2,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-6-35b-a3b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-6-35b-a3b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-6-35b-a3b.md",
      "modelA": {
        "slug": "qwen3-6-35b-a3b",
        "canonicalModelKey": "qwen3-6-35b-a3b",
        "model": "Qwen3.6-35B-A3B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 51.32,
        "provisionalDisplayScore": 41,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 39.81,
          "upper": 62.84
        },
        "rankingEligible": true,
        "overallRank": 123,
        "url": "https://benchlm.ai/models/qwen3-6-35b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-35b-a3b.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 51.32,
      "scoreB": 86,
      "evidenceStatusA": "estimated",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 34.68,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 41,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 51.5,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 14
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 73.8,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 76.3,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 16
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.4,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 88.2,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 6
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-5-35b-a3b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-5-35b-a3b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-5-35b-a3b.md",
      "modelA": {
        "slug": "qwen3-5-35b-a3b",
        "canonicalModelKey": "qwen3-5-35b-a3b",
        "model": "Qwen3.5-35B-A3B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 56.09,
        "provisionalDisplayScore": 40,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 44.13,
          "upper": 68.06
        },
        "rankingEligible": true,
        "overallRank": 100,
        "url": "https://benchlm.ai/models/qwen3-5-35b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-35b-a3b.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 56.09,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29.909999999999997,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 16,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 51,
          "avgB": 87,
          "winner": "B",
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 60.6,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": 59,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 81.6,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": 91.9,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": 81,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": null,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-4-7",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-4-7",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-4-7.md",
      "modelA": {
        "slug": "glm-4-7",
        "canonicalModelKey": "glm-4-7",
        "model": "GLM-4.7",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 60.62,
        "provisionalDisplayScore": 36,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 46.23,
          "upper": 75.01
        },
        "rankingEligible": true,
        "overallRank": 66,
        "url": "https://benchlm.ai/models/glm-4-7",
        "markdownUrl": "https://benchlm.ai/md/models/glm-4-7.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 60.62,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.380000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 13,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 45.7,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 75.4,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": null,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 51.8,
          "avgB": 68.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 1.8,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-4-nano",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-4-nano",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-4-nano.md",
      "modelA": {
        "slug": "gpt-5-4-nano",
        "canonicalModelKey": "gpt-5-4-nano",
        "model": "GPT-5.4 nano",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "400K",
        "contextWindowTokens": 400000,
        "displayScore": 66.39,
        "provisionalDisplayScore": 36,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55.08,
          "upper": 77.69
        },
        "rankingEligible": true,
        "overallRank": 32,
        "url": "https://benchlm.ai/models/gpt-5-4-nano",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-4-nano.md"
      },
      "modelB": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 66.39,
      "scoreB": 86,
      "evidenceStatusA": "supported",
      "evidenceStatusB": null,
      "overallWinner": "B",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 19.61,
      "winsA": 0,
      "winsB": 1,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 13,
      "benchmarkCountB": 15,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 42.9,
          "avgB": 87,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": null,
          "avgB": 89.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 66.1,
          "avgB": 93.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 43.8,
          "avgB": 68.5,
          "winner": "B",
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 21,
          "avgB": 97.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-sakana-fugu-ultra",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-sakana-fugu-ultra",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-sakana-fugu-ultra.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "sakana-fugu-ultra",
        "canonicalModelKey": "sakana-fugu-ultra",
        "model": "Sakana Fugu-Ultra",
        "creator": "Sakana AI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/sakana-fugu-ultra",
        "markdownUrl": "https://benchlm.ai/md/models/sakana-fugu-ultra.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 78,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 8,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 11,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 82.1,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 64.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 86.6,
          "winner": "A",
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 93.6,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 95.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-4-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-4-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-4-pro.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-5-4-pro",
        "canonicalModelKey": "gpt-5-4-pro",
        "model": "GPT-5.4 Pro",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1.05M",
        "contextWindowTokens": 1050000,
        "displayScore": 61.47,
        "provisionalDisplayScore": 78,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.53,
          "upper": 78.41
        },
        "rankingEligible": true,
        "overallRank": 54,
        "url": "https://benchlm.ai/models/gpt-5-4-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-4-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 61.47,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 24.53,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 11,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 89.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 94,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 83.3,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 58.7,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 46.9,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-holo3-35b-a3b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-holo3-35b-a3b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-holo3-35b-a3b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "holo3-35b-a3b",
        "canonicalModelKey": "holo3-35b-a3b",
        "model": "Holo3-35B-A3B",
        "creator": "H Company",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "64K",
        "contextWindowTokens": 64000,
        "displayScore": null,
        "provisionalDisplayScore": 74,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/holo3-35b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/holo3-35b-a3b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 74,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 12,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 82.6,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-swe-1-7",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-swe-1-7",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-swe-1-7.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "swe-1-7",
        "canonicalModelKey": "swe-1-7",
        "model": "SWE-1.7",
        "creator": "Cognition",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 73,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/swe-1-7",
        "markdownUrl": "https://benchlm.ai/md/models/swe-1-7.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 73,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 13,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 81.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-sakana-fugu",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-sakana-fugu",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-sakana-fugu.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "sakana-fugu",
        "canonicalModelKey": "sakana-fugu",
        "model": "Sakana Fugu",
        "creator": "Sakana AI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 73,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/sakana-fugu",
        "markdownUrl": "https://benchlm.ai/md/models/sakana-fugu.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 73,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 13,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 11,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 80.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 59.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 85.1,
          "winner": "A",
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 86.6,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 95.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-grok-4-6",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-grok-4-6",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-grok-4-6.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "grok-4-6",
        "canonicalModelKey": "grok-4-6",
        "model": "Grok 4.6",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "500K",
        "contextWindowTokens": 500000,
        "displayScore": 62.98,
        "provisionalDisplayScore": 72,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.47,
          "upper": 74.5
        },
        "rankingEligible": true,
        "overallRank": 47,
        "url": "https://benchlm.ai/models/grok-4-6",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-6.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 62.98,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 23.020000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-5-3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-5-3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-5-3.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "glm-5-3",
        "canonicalModelKey": "glm-5-3",
        "model": "GLM-5.3",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 62.41,
        "provisionalDisplayScore": 71,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 50.9,
          "upper": 73.93
        },
        "rankingEligible": true,
        "overallRank": 50,
        "url": "https://benchlm.ai/models/glm-5-3",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 62.41,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 23.590000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-exaone-4-0-32b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-exaone-4-0-32b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-exaone-4-0-32b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "exaone-4-0-32b",
        "canonicalModelKey": "exaone-4-0-32b",
        "model": "Exaone 4.0 32B",
        "creator": "LG AI Research",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": null,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/exaone-4-0-32b",
        "markdownUrl": "https://benchlm.ai/md/models/exaone-4-0-32b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 70,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 16,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 81.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-holo3-122b-a10b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-holo3-122b-a10b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-holo3-122b-a10b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "holo3-122b-a10b",
        "canonicalModelKey": "holo3-122b-a10b",
        "model": "Holo3-122B-A10B",
        "creator": "H Company",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "64K",
        "contextWindowTokens": 64000,
        "displayScore": null,
        "provisionalDisplayScore": 70,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/holo3-122b-a10b",
        "markdownUrl": "https://benchlm.ai/md/models/holo3-122b-a10b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 70,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 16,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 78.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ornith-1-5-397b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ornith-1-5-397b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ornith-1-5-397b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ornith-1-5-397b",
        "canonicalModelKey": "ornith-1-5-397b",
        "model": "Ornith-1.5-397B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 67.4,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 57.53,
          "upper": 77.27
        },
        "rankingEligible": true,
        "overallRank": 25,
        "url": "https://benchlm.ai/models/ornith-1-5-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-397b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 67.4,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 18.599999999999994,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 15,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 86.6,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 78,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 51.1,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-dots3-note-preview",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-dots3-note-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-dots3-note-preview.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "dots3-note-preview",
        "canonicalModelKey": "dots3-note-preview",
        "model": "dots3-note Preview",
        "creator": "Dots Studio",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "512K",
        "contextWindowTokens": 512000,
        "displayScore": 68.69,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 58.82,
          "upper": 78.55
        },
        "rankingEligible": true,
        "overallRank": 21,
        "url": "https://benchlm.ai/models/dots3-note-preview",
        "markdownUrl": "https://benchlm.ai/md/models/dots3-note-preview.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 68.69,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 17.310000000000002,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 31,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 83.3,
          "winner": null,
          "benchmarkCount": 12
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 71.7,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 79.1,
          "winner": null,
          "benchmarkCount": 12
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 81.4,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 52.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 85.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-6-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-6-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-6-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemini-3-6-flash",
        "canonicalModelKey": "gemini-3-6-flash",
        "model": "Gemini 3.6 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 75.06,
        "provisionalDisplayScore": 69,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 70.01,
          "upper": 80.1
        },
        "rankingEligible": true,
        "overallRank": 10,
        "url": "https://benchlm.ai/models/gemini-3-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-6-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 75.06,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 10.939999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 83,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-hy4-preview",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-hy4-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-hy4-preview.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "hy4-preview",
        "canonicalModelKey": "hy4-preview",
        "model": "Hy4 preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 78.3,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 68.43,
          "upper": 88.17
        },
        "rankingEligible": true,
        "overallRank": 7,
        "url": "https://benchlm.ai/models/hy4-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy4-preview.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 78.3,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 7.700000000000003,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 28,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 16
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 65.7,
          "winner": null,
          "benchmarkCount": 10
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 66.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 60.4,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ornith-1-0-397b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ornith-1-0-397b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ornith-1-0-397b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ornith-1-0-397b",
        "canonicalModelKey": "ornith-1-0-397b",
        "model": "Ornith-1.0-397B",
        "creator": "DeepReinforce AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 68,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ornith-1-0-397b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-0-397b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 68,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 18,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 77.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 74.6,
          "winner": "A",
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-5-3-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-5-3-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-5-3-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "glm-5-3-flash",
        "canonicalModelKey": "glm-5-3-flash",
        "model": "GLM-5.3-Flash",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 61.25,
        "provisionalDisplayScore": 67,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.73,
          "upper": 72.76
        },
        "rankingEligible": true,
        "overallRank": 56,
        "url": "https://benchlm.ai/models/glm-5-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-3-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 61.25,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 24.75,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 13,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 74.7,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "apodex-1-1-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/apodex-1-1-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/apodex-1-1-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "apodex-1-1",
        "canonicalModelKey": "apodex-1-1",
        "model": "Apodex 1.1",
        "creator": "Apodex",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "N/A",
        "contextWindowTokens": 0,
        "displayScore": 56.11,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 44.6,
          "upper": 67.63
        },
        "rankingEligible": true,
        "overallRank": 99,
        "url": "https://benchlm.ai/models/apodex-1-1",
        "markdownUrl": "https://benchlm.ai/md/models/apodex-1-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 56.11,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29.89,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 10,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 77.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 56.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-8-27b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-8-27b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-8-27b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-8-27b",
        "canonicalModelKey": "qwen3-8-27b",
        "model": "Qwen3.8-27B",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 71.9,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 69.73,
          "upper": 74.07
        },
        "rankingEligible": true,
        "overallRank": 17,
        "url": "https://benchlm.ai/models/qwen3-8-27b",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-27b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 71.9,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 14.099999999999994,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 15,
      "benchmarkCountB": 28,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 84.3,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 61.7,
          "winner": null,
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 90.2,
          "winner": "A",
          "benchmarkCount": 11
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 38.7,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 79.5,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-grok-4-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-grok-4-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-grok-4-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "grok-4-5",
        "canonicalModelKey": "grok-4-5",
        "model": "Grok 4.5",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "500K",
        "contextWindowTokens": 500000,
        "displayScore": 74.9,
        "provisionalDisplayScore": 66,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 70.39,
          "upper": 79.41
        },
        "rankingEligible": true,
        "overallRank": 11,
        "url": "https://benchlm.ai/models/grok-4-5",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 74.9,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 11.099999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 10,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 83.3,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 64.7,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 52.6,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "celeris-1-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/celeris-1-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/celeris-1-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "celeris-1",
        "canonicalModelKey": "celeris-1",
        "model": "Celeris-1",
        "creator": "Celeris",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": null,
        "provisionalDisplayScore": 63,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/celeris-1",
        "markdownUrl": "https://benchlm.ai/md/models/celeris-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 63,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 23,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 75.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 80.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-3-codex",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-3-codex",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-3-codex.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-5-3-codex",
        "canonicalModelKey": "gpt-5-3-codex",
        "model": "GPT-5.3 Codex",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "400K",
        "contextWindowTokens": 400000,
        "displayScore": 65.6,
        "provisionalDisplayScore": 63,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 61.48,
          "upper": 69.72
        },
        "rankingEligible": true,
        "overallRank": 34,
        "url": "https://benchlm.ai/models/gpt-5-3-codex",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-3-codex.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 65.6,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 20.400000000000006,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 71.4,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 67.2,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-deepseek-v3-2",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-deepseek-v3-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-deepseek-v3-2.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "deepseek-v3-2",
        "canonicalModelKey": "deepseek-v3-2",
        "model": "DeepSeek V3.2",
        "creator": "DeepSeek",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 54.64,
        "provisionalDisplayScore": 63,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 37.04,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 105,
        "url": "https://benchlm.ai/models/deepseek-v3-2",
        "markdownUrl": "https://benchlm.ai/md/models/deepseek-v3-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 54.64,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 31.36,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 60.9,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 17.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-composer-2-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-composer-2-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-composer-2-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "composer-2-5",
        "canonicalModelKey": "composer-2-5",
        "model": "Composer 2.5",
        "creator": "Cursor",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": null,
        "provisionalDisplayScore": 62,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/composer-2-5",
        "markdownUrl": "https://benchlm.ai/md/models/composer-2-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 62,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 24,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 69.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "btl-4-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/btl-4-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/btl-4-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "btl-4",
        "canonicalModelKey": "btl-4",
        "model": "BTL-4",
        "creator": "Bad Theory Labs",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 62,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/btl-4",
        "markdownUrl": "https://benchlm.ai/md/models/btl-4.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 62,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 24,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 78.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-8-flash-next",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-8-flash-next",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-8-flash-next.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-8-flash-next",
        "canonicalModelKey": "qwen3-8-flash-next",
        "model": "Qwen3.8-Flash-Next",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 60.91,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.39,
          "upper": 72.42
        },
        "rankingEligible": true,
        "overallRank": 64,
        "url": "https://benchlm.ai/models/qwen3-8-flash-next",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-8-flash-next.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 60.91,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.090000000000003,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 15,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 62.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 90.6,
          "winner": "A",
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 43.4,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 81.3,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-o1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-o1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-o1.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "o1",
        "canonicalModelKey": "o1",
        "model": "o1",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 48.18,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 36.66,
          "upper": 59.69
        },
        "rankingEligible": true,
        "overallRank": 146,
        "url": "https://benchlm.ai/models/o1",
        "markdownUrl": "https://benchlm.ai/md/models/o1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 48.18,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 37.82,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 75.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 92.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 9.3,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mistral-medium-3-5-128b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mistral-medium-3-5-128b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mistral-medium-3-5-128b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "mistral-medium-3-5-128b",
        "canonicalModelKey": "mistral-medium-3-5-128b",
        "model": "Mistral Medium 3.5 128B",
        "creator": "Mistral",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 61,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mistral-medium-3-5-128b",
        "markdownUrl": "https://benchlm.ai/md/models/mistral-medium-3-5-128b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 61,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 77.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-zaya1-8b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-zaya1-8b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-zaya1-8b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "zaya1-8b",
        "canonicalModelKey": "zaya1-8b",
        "model": "ZAYA1-8B",
        "creator": "Zyphra",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "131K",
        "contextWindowTokens": 131000,
        "displayScore": 31.16,
        "provisionalDisplayScore": 60,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 21.29,
          "upper": 41.03
        },
        "rankingEligible": true,
        "overallRank": 210,
        "url": "https://benchlm.ai/models/zaya1-8b",
        "markdownUrl": "https://benchlm.ai/md/models/zaya1-8b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 31.16,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 54.84,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 11,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 73.6,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 64.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 80.4,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-composer-2",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-composer-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-composer-2.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "composer-2",
        "canonicalModelKey": "composer-2",
        "model": "Composer 2",
        "creator": "Cursor",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": null,
        "provisionalDisplayScore": 58,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/composer-2",
        "markdownUrl": "https://benchlm.ai/md/models/composer-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 58,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 28,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 61.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 58,
          "winner": null,
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-4-1-opus-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/claude-4-1-opus-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-4-1-opus-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "claude-4-1-opus",
        "canonicalModelKey": "claude-4-1-opus",
        "model": "Claude 4.1 Opus",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 45.05,
        "provisionalDisplayScore": 58,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 42.05,
          "upper": 48.06
        },
        "rankingEligible": true,
        "overallRank": 170,
        "url": "https://benchlm.ai/models/claude-4-1-opus",
        "markdownUrl": "https://benchlm.ai/md/models/claude-4-1-opus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 45.05,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 40.95,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 74.5,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-laguna-s-2-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-laguna-s-2-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-laguna-s-2-1.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "laguna-s-2-1",
        "canonicalModelKey": "laguna-s-2-1",
        "model": "Laguna S 2.1",
        "creator": "Poolside",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/laguna-s-2-1",
        "markdownUrl": "https://benchlm.ai/md/models/laguna-s-2-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 57,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 70.2,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 59.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-6-max-preview",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-6-max-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-6-max-preview.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-6-max-preview",
        "canonicalModelKey": "qwen3-6-max-preview",
        "model": "Qwen 3.6 Max (preview)",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 60.21,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 41.15,
          "upper": 79.27
        },
        "rankingEligible": true,
        "overallRank": 69,
        "url": "https://benchlm.ai/models/qwen3-6-max-preview",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-6-max-preview.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 60.21,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.79,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 9,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 65.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 51,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 73.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 18.4,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mimo-v2-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mimo-v2-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mimo-v2-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "mimo-v2-flash",
        "canonicalModelKey": "mimo-v2-flash",
        "model": "MiMo-V2-Flash",
        "creator": "Xiaomi",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 53.25,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 38.29,
          "upper": 68.21
        },
        "rankingEligible": true,
        "overallRank": 115,
        "url": "https://benchlm.ai/models/mimo-v2-flash",
        "markdownUrl": "https://benchlm.ai/md/models/mimo-v2-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 53.25,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 32.75,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 73.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 84.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "agents-a1-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/agents-a1-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/agents-a1-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "agents-a1",
        "canonicalModelKey": "agents-a1",
        "model": "Agents-A1",
        "creator": "InternScience",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 61.2,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 51.33,
          "upper": 71.07
        },
        "rankingEligible": true,
        "overallRank": 58,
        "url": "https://benchlm.ai/models/agents-a1",
        "markdownUrl": "https://benchlm.ai/md/models/agents-a1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 61.2,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 24.799999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 75.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 60.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 47.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 94.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-deepseek-v4-flash-0731",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-deepseek-v4-flash-0731",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-deepseek-v4-flash-0731.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "deepseek-v4-flash-0731",
        "canonicalModelKey": "deepseek-v4-flash-max",
        "model": "DeepSeek V4 Flash 0731",
        "creator": "DeepSeek",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/deepseek-v4-flash-0731",
        "markdownUrl": "https://benchlm.ai/md/models/deepseek-v4-flash-0731.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 57,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 35,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 63.8,
          "winner": null,
          "benchmarkCount": 11
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 68.8,
          "winner": "A",
          "benchmarkCount": 13
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 55.3,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 94.8,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ling-3-0-flash-fp8",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ling-3-0-flash-fp8",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ling-3-0-flash-fp8.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ling-3-0-flash-fp8",
        "canonicalModelKey": "ling-3-0-flash-fp8",
        "model": "Ling 3.0 Flash FP8",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": null,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ling-3-0-flash-fp8",
        "markdownUrl": "https://benchlm.ai/md/models/ling-3-0-flash-fp8.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 57,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 40.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 84,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 73.4,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mimo-v2-5-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mimo-v2-5-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mimo-v2-5-pro.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "mimo-v2-5-pro",
        "canonicalModelKey": "mimo-v2-5-pro",
        "model": "MiMo-V2.5-Pro",
        "creator": "Xiaomi",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 68.9,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 59.51,
          "upper": 78.29
        },
        "rankingEligible": true,
        "overallRank": 20,
        "url": "https://benchlm.ai/models/mimo-v2-5-pro",
        "markdownUrl": "https://benchlm.ai/md/models/mimo-v2-5-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 68.9,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 17.099999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 68.4,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 57.2,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 48,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-5-flash-lite",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-5-flash-lite",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-5-flash-lite.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemini-3-5-flash-lite",
        "canonicalModelKey": "gemini-3-5-flash-lite",
        "model": "Gemini 3.5 Flash-Lite",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.04,
        "provisionalDisplayScore": 57,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 52.89,
          "upper": 77.19
        },
        "rankingEligible": true,
        "overallRank": 37,
        "url": "https://benchlm.ai/models/gemini-3-5-flash-lite",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-5-flash-lite.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 65.04,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 20.959999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 63.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 54.2,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 72.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-4-sonnet-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/claude-4-sonnet-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-4-sonnet-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "claude-4-sonnet",
        "canonicalModelKey": "claude-4-sonnet",
        "model": "Claude 4 Sonnet",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 42.07,
        "provisionalDisplayScore": 56,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 38.83,
          "upper": 45.31
        },
        "rankingEligible": true,
        "overallRank": 187,
        "url": "https://benchlm.ai/models/claude-4-sonnet",
        "markdownUrl": "https://benchlm.ai/md/models/claude-4-sonnet.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 42.07,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 43.93,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 72.7,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-lfm2-5-2-6b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-lfm2-5-2-6b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-lfm2-5-2-6b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "lfm2-5-2-6b",
        "canonicalModelKey": "lfm2-5-2-6b",
        "model": "LFM2.5-2.6B",
        "creator": "LiquidAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 42.9,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 31.39,
          "upper": 54.42
        },
        "rankingEligible": true,
        "overallRank": 181,
        "url": "https://benchlm.ai/models/lfm2-5-2-6b",
        "markdownUrl": "https://benchlm.ai/md/models/lfm2-5-2-6b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 42.9,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 43.1,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 59.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-kimi-k2-5-reasoning",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-kimi-k2-5-reasoning",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-kimi-k2-5-reasoning.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "kimi-k2-5-reasoning",
        "canonicalModelKey": "kimi-k2-5-reasoning",
        "model": "Kimi K2.5 (Reasoning)",
        "creator": "Moonshot AI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 60.12,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.61,
          "upper": 71.63
        },
        "rankingEligible": true,
        "overallRank": 70,
        "url": "https://benchlm.ai/models/kimi-k2-5-reasoning",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2-5-reasoning.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 60.12,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.880000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 9,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 55,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 76.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 78.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 87.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemini-3-flash",
        "canonicalModelKey": "gemini-3-flash",
        "model": "Gemini 3 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 59.74,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 39.96,
          "upper": 79.52
        },
        "rankingEligible": true,
        "overallRank": 73,
        "url": "https://benchlm.ai/models/gemini-3-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 59.74,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.259999999999998,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 27.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-interfaze-beta",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-interfaze-beta",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-interfaze-beta.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "interfaze-beta",
        "canonicalModelKey": "interfaze-beta",
        "model": "Interfaze Beta",
        "creator": "Interfaze",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/interfaze-beta",
        "markdownUrl": "https://benchlm.ai/md/models/interfaze-beta.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 55,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 31,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 9,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 71.1,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 89.9,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-muse-spark",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-muse-spark",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-muse-spark.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "muse-spark",
        "canonicalModelKey": "muse-spark",
        "model": "Muse Spark",
        "creator": "Meta",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 70.59,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 60.6,
          "upper": 80.58
        },
        "rankingEligible": true,
        "overallRank": 19,
        "url": "https://benchlm.ai/models/muse-spark",
        "markdownUrl": "https://benchlm.ai/md/models/muse-spark.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 70.59,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 15.409999999999997,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 24,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 59,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 67.8,
          "winner": "A",
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 82.5,
          "winner": null,
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 42.5,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 50.4,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 32.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-1.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-5-1",
        "canonicalModelKey": "gpt-5-1",
        "model": "GPT-5.1",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 53.41,
        "provisionalDisplayScore": 55,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 41.9,
          "upper": 64.93
        },
        "rankingEligible": true,
        "overallRank": 114,
        "url": "https://benchlm.ai/models/gpt-5-1",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 53.41,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 32.59,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 26.4,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ornith-1-0-35b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ornith-1-0-35b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ornith-1-0-35b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ornith-1-0-35b",
        "canonicalModelKey": "ornith-1-0-35b",
        "model": "Ornith-1.0-35B",
        "creator": "DeepReinforce AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 54,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ornith-1-0-35b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-0-35b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 54,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 32,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 65.9,
          "winner": "A",
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-grok-4-3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-grok-4-3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-grok-4-3.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "grok-4-3",
        "canonicalModelKey": "grok-4-3",
        "model": "Grok 4.3",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 63.82,
        "provisionalDisplayScore": 54,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 52.9,
          "upper": 74.74
        },
        "rankingEligible": true,
        "overallRank": 44,
        "url": "https://benchlm.ai/models/grok-4-3",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 63.82,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 22.18,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-haiku-4-5-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/claude-haiku-4-5-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-haiku-4-5-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "claude-haiku-4-5",
        "canonicalModelKey": "claude-haiku-4-5",
        "model": "Claude Haiku 4.5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 57.35,
        "provisionalDisplayScore": 54,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 45.84,
          "upper": 68.86
        },
        "rankingEligible": true,
        "overallRank": 91,
        "url": "https://benchlm.ai/models/claude-haiku-4-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-haiku-4-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 57.35,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 28.65,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 73.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 4.9,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mimo-v2-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mimo-v2-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mimo-v2-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "mimo-v2-5",
        "canonicalModelKey": "mimo-v2-5",
        "model": "MiMo-V2.5",
        "creator": "Xiaomi",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 59.46,
        "provisionalDisplayScore": 54,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 47.94,
          "upper": 70.97
        },
        "rankingEligible": true,
        "overallRank": 78,
        "url": "https://benchlm.ai/models/mimo-v2-5",
        "markdownUrl": "https://benchlm.ai/md/models/mimo-v2-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 59.46,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.54,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 10,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 65.8,
          "winner": null,
          "benchmarkCount": 8
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 56.1,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 79,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-235b-2507",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-235b-2507",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-235b-2507.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-235b-2507",
        "canonicalModelKey": "qwen3-235b-2507",
        "model": "Qwen3 235B 2507",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 56.75,
        "provisionalDisplayScore": 53,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 45.23,
          "upper": 68.26
        },
        "rankingEligible": true,
        "overallRank": 95,
        "url": "https://benchlm.ai/models/qwen3-235b-2507",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-235b-2507.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 56.75,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29.25,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 78.9,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": 79.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-pro-deep-think",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-pro-deep-think",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-pro-deep-think.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemini-3-pro-deep-think",
        "canonicalModelKey": "gemini-3-pro-deep-think",
        "model": "Gemini 3 Pro Deep Think",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "2M",
        "contextWindowTokens": 2000000,
        "displayScore": 62.1,
        "provisionalDisplayScore": 52,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 50.59,
          "upper": 73.62
        },
        "rankingEligible": true,
        "overallRank": 52,
        "url": "https://benchlm.ai/models/gemini-3-pro-deep-think",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-pro-deep-think.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 62.1,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 23.9,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 45.1,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-o4-mini-high",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-o4-mini-high",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-o4-mini-high.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "o4-mini-high",
        "canonicalModelKey": "o4-mini-high",
        "model": "o4-mini (high)",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 50.62,
        "provisionalDisplayScore": 52,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 39.11,
          "upper": 62.14
        },
        "rankingEligible": true,
        "overallRank": 132,
        "url": "https://benchlm.ai/models/o4-mini-high",
        "markdownUrl": "https://benchlm.ai/md/models/o4-mini-high.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 50.62,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 35.38,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 20.2,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mellum2-12b-a2-5b-thinking",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mellum2-12b-a2-5b-thinking",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mellum2-12b-a2-5b-thinking.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "mellum2-12b-a2-5b-thinking",
        "canonicalModelKey": "mellum2-12b-a2-5b-thinking",
        "model": "Mellum2-12B-A2.5B-Thinking",
        "creator": "JetBrains",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": null,
        "provisionalDisplayScore": 51,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mellum2-12b-a2-5b-thinking",
        "markdownUrl": "https://benchlm.ai/md/models/mellum2-12b-a2-5b-thinking.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 51,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 35,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 57.6,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 76.5,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-step-3-7-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-step-3-7-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-step-3-7-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "step-3-7-flash",
        "canonicalModelKey": "step-3-7-flash",
        "model": "Step 3.7 Flash",
        "creator": "StepFun",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 50.83,
        "provisionalDisplayScore": 51,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 39.31,
          "upper": 62.34
        },
        "rankingEligible": true,
        "overallRank": 127,
        "url": "https://benchlm.ai/models/step-3-7-flash",
        "markdownUrl": "https://benchlm.ai/md/models/step-3-7-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 50.83,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 35.17,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 11,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 66.4,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 56.3,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ornith-1-5-35b-a3b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ornith-1-5-35b-a3b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ornith-1-5-35b-a3b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ornith-1-5-35b-a3b",
        "canonicalModelKey": "ornith-1-5-35b-a3b",
        "model": "Ornith-1.5-35B-A3B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 47.9,
        "provisionalDisplayScore": 51,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 38.03,
          "upper": 57.77
        },
        "rankingEligible": true,
        "overallRank": 149,
        "url": "https://benchlm.ai/models/ornith-1-5-35b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-35b-a3b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 47.9,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 38.1,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 15,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 67.6,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 71.5,
          "winner": "A",
          "benchmarkCount": 8
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 34.2,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-o3-mini",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-o3-mini",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-o3-mini.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "o3-mini",
        "canonicalModelKey": "o3-mini",
        "model": "o3-mini",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 46.69,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 31.65,
          "upper": 61.73
        },
        "rankingEligible": true,
        "overallRank": 158,
        "url": "https://benchlm.ai/models/o3-mini",
        "markdownUrl": "https://benchlm.ai/md/models/o3-mini.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 46.69,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 39.31,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 49.3,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 77.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 93.9,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-soofi-s-30b-a3b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-soofi-s-30b-a3b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-soofi-s-30b-a3b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "soofi-s-30b-a3b",
        "canonicalModelKey": "soofi-s-30b-a3b",
        "model": "Soofi S 30B-A3B",
        "creator": "Soofi Project",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/soofi-s-30b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/soofi-s-30b-a3b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 50,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 36,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 49.9,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-lfm2-5-8b-a1b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-lfm2-5-8b-a1b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-lfm2-5-8b-a1b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "lfm2-5-8b-a1b",
        "canonicalModelKey": "lfm2-5-8b-a1b",
        "model": "LFM2.5-8B-A1B",
        "creator": "LiquidAI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 41.78,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 30.27,
          "upper": 53.3
        },
        "rankingEligible": true,
        "overallRank": 188,
        "url": "https://benchlm.ai/models/lfm2-5-8b-a1b",
        "markdownUrl": "https://benchlm.ai/md/models/lfm2-5-8b-a1b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 41.78,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 44.22,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 68.8,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 50,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-5-plus",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-5-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-5-plus.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-5-plus",
        "canonicalModelKey": "qwen3-5-plus",
        "model": "Qwen3.5 Plus",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 47.79,
        "provisionalDisplayScore": 50,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 33.82,
          "upper": 61.76
        },
        "rankingEligible": true,
        "overallRank": 150,
        "url": "https://benchlm.ai/models/qwen3-5-plus",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 47.79,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 38.21,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 16.3,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-kimi-k2",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-kimi-k2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-kimi-k2.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "kimi-k2",
        "canonicalModelKey": "kimi-k2",
        "model": "Kimi K2",
        "creator": "Moonshot AI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 26.24,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 16.05,
          "upper": 36.43
        },
        "rankingEligible": true,
        "overallRank": 213,
        "url": "https://benchlm.ai/models/kimi-k2",
        "markdownUrl": "https://benchlm.ai/md/models/kimi-k2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 26.24,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 59.760000000000005,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 16.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-minimax-m2-7",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-minimax-m2-7",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-minimax-m2-7.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "minimax-m2-7",
        "canonicalModelKey": "minimax-m2-7",
        "model": "MiniMax M2.7",
        "creator": "MiniMax",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 62.85,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 55,
          "upper": 70.7
        },
        "rankingEligible": true,
        "overallRank": 49,
        "url": "https://benchlm.ai/models/minimax-m2-7",
        "markdownUrl": "https://benchlm.ai/md/models/minimax-m2-7.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 62.85,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 23.15,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 57,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 53.3,
          "winner": null,
          "benchmarkCount": 11
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-grok-4",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-grok-4",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-grok-4.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "grok-4",
        "canonicalModelKey": "grok-4",
        "model": "Grok 4",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.42,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 48.8,
          "upper": 70.04
        },
        "rankingEligible": true,
        "overallRank": 79,
        "url": "https://benchlm.ai/models/grok-4",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 59.42,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.58,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 15.3,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-o3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-o3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-o3.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "o3",
        "canonicalModelKey": "o3",
        "model": "o3",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 46.82,
        "provisionalDisplayScore": 49,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 43.88,
          "upper": 49.76
        },
        "rankingEligible": true,
        "overallRank": 157,
        "url": "https://benchlm.ai/models/o3",
        "markdownUrl": "https://benchlm.ai/md/models/o3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 46.82,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 39.18,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 14.5,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-granite-4-2-8b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-granite-4-2-8b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-granite-4-2-8b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "granite-4-2-8b",
        "canonicalModelKey": "granite-4-2-8b",
        "model": "Granite 4.2 8B",
        "creator": "IBM",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 46.32,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 34.8,
          "upper": 57.83
        },
        "rankingEligible": true,
        "overallRank": 161,
        "url": "https://benchlm.ai/models/granite-4-2-8b",
        "markdownUrl": "https://benchlm.ai/md/models/granite-4-2-8b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 46.32,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 39.68,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 14,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 36.5,
          "winner": null,
          "benchmarkCount": 7
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 72.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 79.3,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-nemotron-3-nano-omni-30b-a3b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-nemotron-3-nano-omni-30b-a3b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-nemotron-3-nano-omni-30b-a3b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "nemotron-3-nano-omni-30b-a3b",
        "canonicalModelKey": "nemotron-3-nano-omni-30b-a3b",
        "model": "Nemotron 3 Nano Omni 30B A3B",
        "creator": "NVIDIA",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 44.49,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 32.98,
          "upper": 56
        },
        "rankingEligible": true,
        "overallRank": 172,
        "url": "https://benchlm.ai/models/nemotron-3-nano-omni-30b-a3b",
        "markdownUrl": "https://benchlm.ai/md/models/nemotron-3-nano-omni-30b-a3b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 44.49,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 41.51,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 32,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 76.3,
          "winner": "A",
          "benchmarkCount": 9
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 76.3,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 74.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-4-1-nano",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-4-1-nano",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-4-1-nano.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-4-1-nano",
        "canonicalModelKey": "gpt-4-1-nano",
        "model": "GPT-4.1 nano",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 42.38,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 30.86,
          "upper": 53.89
        },
        "rankingEligible": true,
        "overallRank": 183,
        "url": "https://benchlm.ai/models/gpt-4-1-nano",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-4-1-nano.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 42.38,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 43.62,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 50.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 83.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 1,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-pokee-isaac-28b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-pokee-isaac-28b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-pokee-isaac-28b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "pokee-isaac-28b",
        "canonicalModelKey": "pokee-isaac-28b",
        "model": "Pokee-Isaac 28B",
        "creator": "Pokee AI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "10M",
        "contextWindowTokens": 10000000,
        "displayScore": null,
        "provisionalDisplayScore": 48,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/pokee-isaac-28b",
        "markdownUrl": "https://benchlm.ai/md/models/pokee-isaac-28b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 48,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 38,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 9
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 60.7,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemma-4-26b-a4b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemma-4-26b-a4b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemma-4-26b-a4b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemma-4-26b-a4b",
        "canonicalModelKey": "gemma-4-26b-a4b",
        "model": "Gemma 4 26B A4B",
        "creator": "Google",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 57.12,
        "provisionalDisplayScore": 46,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 39.05,
          "upper": 75.18
        },
        "rankingEligible": true,
        "overallRank": 93,
        "url": "https://benchlm.ai/models/gemma-4-26b-a4b",
        "markdownUrl": "https://benchlm.ai/md/models/gemma-4-26b-a4b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 57.12,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 28.880000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 73.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 43.4,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-sonnet-4-5",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-sonnet-4-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-sonnet-4-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "claude-sonnet-4-5",
        "canonicalModelKey": "claude-sonnet-4-5",
        "model": "Claude Sonnet 4.5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 54.48,
        "provisionalDisplayScore": 46,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 42.96,
          "upper": 65.99
        },
        "rankingEligible": true,
        "overallRank": 106,
        "url": "https://benchlm.ai/models/claude-sonnet-4-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-sonnet-4-5.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 54.48,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 31.520000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 11,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 55.4,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 77.2,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 13.6,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 83.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 11.2,
          "winner": null,
          "benchmarkCount": 4
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-3-1-flash-lite",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-3-1-flash-lite",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-3-1-flash-lite.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemini-3-1-flash-lite",
        "canonicalModelKey": "gemini-3-1-flash-lite",
        "model": "Gemini 3.1 Flash-Lite",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 50.82,
        "provisionalDisplayScore": 46,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 24.61,
          "upper": 77.03
        },
        "rankingEligible": true,
        "overallRank": 129,
        "url": "https://benchlm.ai/models/gemini-3-1-flash-lite",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-3-1-flash-lite.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 50.82,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 35.18,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 73.2,
          "winner": "A",
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-hy3-preview",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-hy3-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-hy3-preview.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "hy3-preview",
        "canonicalModelKey": "hy3-preview",
        "model": "Hy3 Preview",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 43.71,
        "provisionalDisplayScore": 46,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 33.84,
          "upper": 53.58
        },
        "rankingEligible": true,
        "overallRank": 176,
        "url": "https://benchlm.ai/models/hy3-preview",
        "markdownUrl": "https://benchlm.ai/md/models/hy3-preview.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 43.71,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 42.29,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 54.4,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 74.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 87.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-zaya1-74b-preview",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-zaya1-74b-preview",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-zaya1-74b-preview.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "zaya1-74b-preview",
        "canonicalModelKey": "zaya1-74b-preview",
        "model": "ZAYA1-74B-Preview",
        "creator": "Zyphra",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 46,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/zaya1-74b-preview",
        "markdownUrl": "https://benchlm.ai/md/models/zaya1-74b-preview.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 46,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 40,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 53.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 66.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 76.4,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-235b-2507-reasoning",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-235b-2507-reasoning",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-235b-2507-reasoning.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-235b-2507-reasoning",
        "canonicalModelKey": "qwen3-235b-2507-reasoning",
        "model": "Qwen3 235B 2507 (Reasoning)",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 58.77,
        "provisionalDisplayScore": 45,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 47.26,
          "upper": 70.29
        },
        "rankingEligible": true,
        "overallRank": 83,
        "url": "https://benchlm.ai/models/qwen3-235b-2507-reasoning",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-235b-2507-reasoning.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 58.77,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 27.229999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 6.4,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-4-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-4-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-4-1.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-4-1",
        "canonicalModelKey": "gpt-4-1",
        "model": "GPT-4.1",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 50.83,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 30.52,
          "upper": 71.13
        },
        "rankingEligible": true,
        "overallRank": 128,
        "url": "https://benchlm.ai/models/gpt-4-1",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-4-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 50.83,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 35.17,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 54.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 66.3,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 87.4,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 4.1,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-4-1-mini",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-4-1-mini",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-4-1-mini.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-4-1-mini",
        "canonicalModelKey": "gpt-4-1-mini",
        "model": "GPT-4.1 mini",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 44.4,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 32.89,
          "upper": 55.92
        },
        "rankingEligible": true,
        "overallRank": 173,
        "url": "https://benchlm.ai/models/gpt-4-1-mini",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-4-1-mini.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 44.4,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 41.6,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 23.6,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 64.2,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 88.5,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 4.5,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-grok-4-20-beta",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-grok-4-20-beta",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-grok-4-20-beta.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "grok-4-20-beta",
        "canonicalModelKey": "grok-4-20-beta",
        "model": "Grok 4.20",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "2M",
        "contextWindowTokens": 2000000,
        "displayScore": 55.42,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 38.52,
          "upper": 72.32
        },
        "rankingEligible": true,
        "overallRank": 102,
        "url": "https://benchlm.ai/models/grok-4-20-beta",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-20-beta.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 55.42,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 30.58,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 18,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 47.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 67.1,
          "winner": "A",
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 70.1,
          "winner": null,
          "benchmarkCount": 7
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 53.3,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-2-5-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-2-5-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-2-5-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemini-2-5-flash",
        "canonicalModelKey": "gemini-2-5-flash",
        "model": "Gemini 2.5 Flash",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 47.56,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 24.4,
          "upper": 70.73
        },
        "rankingEligible": true,
        "overallRank": 153,
        "url": "https://benchlm.ai/models/gemini-2-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-2-5-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 47.56,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 38.44,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 4.7,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-5-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-5-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-5-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-5-flash",
        "canonicalModelKey": "qwen3-5-flash",
        "model": "Qwen3.5 Flash",
        "creator": "Alibaba",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 47.56,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 24.54,
          "upper": 70.59
        },
        "rankingEligible": true,
        "overallRank": 152,
        "url": "https://benchlm.ai/models/qwen3-5-flash",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 47.56,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 38.44,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 4.7,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mellum2-12b-a2-5b-instruct",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mellum2-12b-a2-5b-instruct",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mellum2-12b-a2-5b-instruct.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "mellum2-12b-a2-5b-instruct",
        "canonicalModelKey": "mellum2-12b-a2-5b-instruct",
        "model": "Mellum2-12B-A2.5B-Instruct",
        "creator": "JetBrains",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": null,
        "provisionalDisplayScore": 44,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/mellum2-12b-a2-5b-instruct",
        "markdownUrl": "https://benchlm.ai/md/models/mellum2-12b-a2-5b-instruct.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 44,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 42,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 40.9,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 75.8,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-laguna-m-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-laguna-m-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-laguna-m-1.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "laguna-m-1",
        "canonicalModelKey": "laguna-m-1",
        "model": "Laguna M.1",
        "creator": "Poolside",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/laguna-m-1",
        "markdownUrl": "https://benchlm.ai/md/models/laguna-m-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 43,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 43,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 45.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 64.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-4-6",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-4-6",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-4-6.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "glm-4-6",
        "canonicalModelKey": "glm-4-6",
        "model": "GLM-4.6",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 54.36,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 35.64,
          "upper": 73.07
        },
        "rankingEligible": true,
        "overallRank": 107,
        "url": "https://benchlm.ai/models/glm-4-6",
        "markdownUrl": "https://benchlm.ai/md/models/glm-4-6.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 54.36,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 31.64,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 3,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 3.4,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemma-4-31b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemma-4-31b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemma-4-31b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemma-4-31b",
        "canonicalModelKey": "gemma-4-31b",
        "model": "Gemma 4 31B",
        "creator": "Google",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 60.08,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 43.34,
          "upper": 76.82
        },
        "rankingEligible": true,
        "overallRank": 71,
        "url": "https://benchlm.ai/models/gemma-4-31b",
        "markdownUrl": "https://benchlm.ai/md/models/gemma-4-31b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 60.08,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 8,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 41.6,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 76.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 52.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-grok-3-beta",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-grok-3-beta",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-grok-3-beta.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "grok-3-beta",
        "canonicalModelKey": "grok-3-beta",
        "model": "Grok 3 [Beta]",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 40.33,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 8.65,
          "upper": 72
        },
        "rankingEligible": true,
        "overallRank": 197,
        "url": "https://benchlm.ai/models/grok-3-beta",
        "markdownUrl": "https://benchlm.ai/md/models/grok-3-beta.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 40.33,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 45.67,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 2,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 2.8,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-deepseek-v3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-deepseek-v3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-deepseek-v3.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "deepseek-v3",
        "canonicalModelKey": "deepseek-v3",
        "model": "DeepSeek V3",
        "creator": "DeepSeek",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 44.38,
        "provisionalDisplayScore": 43,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 25.19,
          "upper": 63.57
        },
        "rankingEligible": true,
        "overallRank": 174,
        "url": "https://benchlm.ai/models/deepseek-v3",
        "markdownUrl": "https://benchlm.ai/md/models/deepseek-v3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 44.38,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 41.62,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 38.9,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 72.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 86.1,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 1.7,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-3-5-sonnet-vs-claude-mythos-5",
      "url": "https://benchlm.ai/compare/claude-3-5-sonnet-vs-claude-mythos-5",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-3-5-sonnet-vs-claude-mythos-5.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "claude-3-5-sonnet",
        "canonicalModelKey": "claude-3-5-sonnet",
        "model": "Claude 3.5 Sonnet",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 48.36,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 36.85,
          "upper": 59.87
        },
        "rankingEligible": true,
        "overallRank": 144,
        "url": "https://benchlm.ai/models/claude-3-5-sonnet",
        "markdownUrl": "https://benchlm.ai/md/models/claude-3-5-sonnet.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 48.36,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 37.64,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 49,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 59.4,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 1.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-4o",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-4o",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-4o.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-4o",
        "canonicalModelKey": "gpt-4o",
        "model": "GPT-4o",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 40.96,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 21.58,
          "upper": 60.34
        },
        "rankingEligible": true,
        "overallRank": 191,
        "url": "https://benchlm.ai/models/gpt-4o",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-4o.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 40.96,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 45.04,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 0.3,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-llama-4-scout",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-llama-4-scout",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-llama-4-scout.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "llama-4-scout",
        "canonicalModelKey": "llama-4-scout",
        "model": "Llama 4 Scout",
        "creator": "Meta",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "10M",
        "contextWindowTokens": 10000000,
        "displayScore": 39.55,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 20.68,
          "upper": 58.41
        },
        "rankingEligible": true,
        "overallRank": 200,
        "url": "https://benchlm.ai/models/llama-4-scout",
        "markdownUrl": "https://benchlm.ai/md/models/llama-4-scout.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 39.55,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 46.45,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-llama-4-maverick",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-llama-4-maverick",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-llama-4-maverick.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "llama-4-maverick",
        "canonicalModelKey": "llama-4-maverick",
        "model": "Llama 4 Maverick",
        "creator": "Meta",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 22.76,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 15.17,
          "upper": 30.34
        },
        "rankingEligible": true,
        "overallRank": 215,
        "url": "https://benchlm.ai/models/llama-4-maverick",
        "markdownUrl": "https://benchlm.ai/md/models/llama-4-maverick.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 22.76,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 63.239999999999995,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 0.7,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ling-2-6-flash",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ling-2-6-flash",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ling-2-6-flash.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ling-2-6-flash",
        "canonicalModelKey": "ling-2-6-flash",
        "model": "Ling 2.6 Flash",
        "creator": "InclusionAI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 44.18,
        "provisionalDisplayScore": 42,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 32.66,
          "upper": 55.69
        },
        "rankingEligible": true,
        "overallRank": 175,
        "url": "https://benchlm.ai/models/ling-2-6-flash",
        "markdownUrl": "https://benchlm.ai/md/models/ling-2-6-flash.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 44.18,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 41.82,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemma-4-12b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemma-4-12b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemma-4-12b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemma-4-12b",
        "canonicalModelKey": "gemma-4-12b",
        "model": "Gemma 4 12B",
        "creator": "Google",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 47.33,
        "provisionalDisplayScore": 41,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 35.82,
          "upper": 58.85
        },
        "rankingEligible": true,
        "overallRank": 154,
        "url": "https://benchlm.ai/models/gemma-4-12b",
        "markdownUrl": "https://benchlm.ai/md/models/gemma-4-12b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 47.33,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 38.67,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 12,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 69.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": 43.4,
          "winner": null,
          "benchmarkCount": 2
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 77.5,
          "winner": null,
          "benchmarkCount": 6
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 77.5,
          "winner": null,
          "benchmarkCount": 2
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gemini-2-5-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gemini-2-5-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gemini-2-5-pro.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gemini-2-5-pro",
        "canonicalModelKey": "gemini-2-5-pro",
        "model": "Gemini 2.5 Pro",
        "creator": "Google",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 56.77,
        "provisionalDisplayScore": 41,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 38.38,
          "upper": 75.17
        },
        "rankingEligible": true,
        "overallRank": 94,
        "url": "https://benchlm.ai/models/gemini-2-5-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gemini-2-5-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 56.77,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 29.229999999999997,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 63.8,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 27.4,
          "winner": "A",
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 11.6,
          "winner": null,
          "benchmarkCount": 3
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-minicpm5-1b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-minicpm5-1b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-minicpm5-1b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "minicpm5-1b",
        "canonicalModelKey": "minicpm5-1b",
        "model": "MiniCPM5-1B",
        "creator": "OpenBMB",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "131K",
        "contextWindowTokens": 131000,
        "displayScore": 11.08,
        "provisionalDisplayScore": 40,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 1.21,
          "upper": 20.95
        },
        "rankingEligible": true,
        "overallRank": 225,
        "url": "https://benchlm.ai/models/minicpm5-1b",
        "markdownUrl": "https://benchlm.ai/md/models/minicpm5-1b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 11.08,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 74.92,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 14,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 44,
          "winner": null,
          "benchmarkCount": 7
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 58.5,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": 33.1,
          "winner": null,
          "benchmarkCount": 5
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ornith-1-0-9b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ornith-1-0-9b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ornith-1-0-9b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ornith-1-0-9b",
        "canonicalModelKey": "ornith-1-0-9b",
        "model": "Ornith-1.0-9B",
        "creator": "DeepReinforce AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 40,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/ornith-1-0-9b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-0-9b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 40,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 46,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 43.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 59.2,
          "winner": "A",
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-laguna-xs-2",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-laguna-xs-2",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-laguna-xs-2.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "laguna-xs-2",
        "canonicalModelKey": "laguna-xs-2",
        "model": "Laguna XS.2",
        "creator": "Poolside",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": null,
        "provisionalDisplayScore": 39,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/laguna-xs-2",
        "markdownUrl": "https://benchlm.ai/md/models/laguna-xs-2.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 39,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 47,
      "winsA": 1,
      "winsB": 0,
      "comparableCategoryCount": 1,
      "benchmarkCountA": 15,
      "benchmarkCountB": 5,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 35.7,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 60.8,
          "winner": "A",
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-ornith-1-5-9b",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-ornith-1-5-9b",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-ornith-1-5-9b.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "ornith-1-5-9b",
        "canonicalModelKey": "ornith-1-5-9b",
        "model": "Ornith-1.5-9B",
        "creator": "Ornith AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "262K",
        "contextWindowTokens": 262000,
        "displayScore": 37.33,
        "provisionalDisplayScore": 39,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 27.46,
          "upper": 47.2
        },
        "rankingEligible": true,
        "overallRank": 205,
        "url": "https://benchlm.ai/models/ornith-1-5-9b",
        "markdownUrl": "https://benchlm.ai/md/models/ornith-1-5-9b.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 37.33,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 48.67,
      "winsA": 2,
      "winsB": 0,
      "comparableCategoryCount": 2,
      "benchmarkCountA": 15,
      "benchmarkCountB": 16,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 56.4,
          "winner": null,
          "benchmarkCount": 10
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 61.7,
          "winner": "A",
          "benchmarkCount": 6
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 29.1,
          "winner": "A",
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-nemotron-3-5-lightning-30b-a3b-nvfp4",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-nemotron-3-5-lightning-30b-a3b-nvfp4",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-nemotron-3-5-lightning-30b-a3b-nvfp4.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "nemotron-3-5-lightning-30b-a3b-nvfp4",
        "canonicalModelKey": "nemotron-3-5-lightning-30b-a3b-nvfp4",
        "model": "Nemotron 3.5 Lightning 30B A3B NVFP4",
        "creator": "NVIDIA",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 26.55,
        "provisionalDisplayScore": 37,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 16.68,
          "upper": 36.42
        },
        "rankingEligible": true,
        "overallRank": 212,
        "url": "https://benchlm.ai/models/nemotron-3-5-lightning-30b-a3b-nvfp4",
        "markdownUrl": "https://benchlm.ai/md/models/nemotron-3-5-lightning-30b-a3b-nvfp4.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 26.55,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 59.45,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 13,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": 29.1,
          "winner": null,
          "benchmarkCount": 6
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 42.1,
          "winner": null,
          "benchmarkCount": 5
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 80.5,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 72.9,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-lfm2-5-vl-450m",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-lfm2-5-vl-450m",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-lfm2-5-vl-450m.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "lfm2-5-vl-450m",
        "canonicalModelKey": "lfm2-5-vl-450m",
        "model": "LFM2.5-VL-450M",
        "creator": "LiquidAI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": null,
        "provisionalDisplayScore": 35,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/lfm2-5-vl-450m",
        "markdownUrl": "https://benchlm.ai/md/models/lfm2-5-vl-450m.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 35,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 51,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 7,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 6
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 20.5,
          "winner": null,
          "benchmarkCount": 4
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 61.2,
          "winner": null,
          "benchmarkCount": 1
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-command-a-plus",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-command-a-plus",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-command-a-plus.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "command-a-plus",
        "canonicalModelKey": "command-a-plus",
        "model": "Command A+",
        "creator": "Cohere",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 47.57,
        "provisionalDisplayScore": 31,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 36.06,
          "upper": 59.09
        },
        "rankingEligible": true,
        "overallRank": 151,
        "url": "https://benchlm.ai/models/command-a-plus",
        "markdownUrl": "https://benchlm.ai/md/models/command-a-plus.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 47.57,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 38.43,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": 59.3,
          "winner": null,
          "benchmarkCount": 5
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-lfm2-5-230m",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-lfm2-5-230m",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-lfm2-5-230m.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "lfm2-5-230m",
        "canonicalModelKey": "lfm2-5-230m",
        "model": "LFM2.5-230M",
        "creator": "LiquidAI",
        "sourceType": "Open Weight",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "32K",
        "contextWindowTokens": 32000,
        "displayScore": null,
        "provisionalDisplayScore": 31,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/lfm2-5-230m",
        "markdownUrl": "https://benchlm.ai/md/models/lfm2-5-230m.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 31,
      "evidenceStatusA": null,
      "evidenceStatusB": null,
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 55,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 6,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": 21.2,
          "winner": null,
          "benchmarkCount": 5
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": 50.1,
          "winner": null,
          "benchmarkCount": 2
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-claude-opus-4-6-thinking",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-claude-opus-4-6-thinking",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-claude-opus-4-6-thinking.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "claude-opus-4-6-thinking",
        "canonicalModelKey": "claude-opus-4-6-thinking",
        "model": "Claude Opus 4.6 (Adaptive)",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 65.03,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 53.52,
          "upper": 76.55
        },
        "rankingEligible": true,
        "overallRank": 38,
        "url": "https://benchlm.ai/models/claude-opus-4-6-thinking",
        "markdownUrl": "https://benchlm.ai/md/models/claude-opus-4-6-thinking.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 65.03,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 20.97,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-grok-4-1",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-grok-4-1",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-grok-4-1.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "grok-4-1",
        "canonicalModelKey": "grok-4-1",
        "model": "Grok 4.1",
        "creator": "xAI",
        "sourceType": "Proprietary",
        "reasoningType": "Non-Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 60.73,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.22,
          "upper": 72.24
        },
        "rankingEligible": true,
        "overallRank": 65,
        "url": "https://benchlm.ai/models/grok-4-1",
        "markdownUrl": "https://benchlm.ai/md/models/grok-4-1.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 60.73,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.270000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-hy3",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-hy3",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-hy3.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "hy3",
        "canonicalModelKey": "hy3",
        "model": "Hy3",
        "creator": "Tencent",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "256K",
        "contextWindowTokens": 256000,
        "displayScore": 67.65,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 58.81,
          "upper": 76.49
        },
        "rankingEligible": true,
        "overallRank": 24,
        "url": "https://benchlm.ai/models/hy3",
        "markdownUrl": "https://benchlm.ai/md/models/hy3.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 67.65,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 18.349999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-5-reasoning",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-5-reasoning",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-5-reasoning.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "glm-5-reasoning",
        "canonicalModelKey": "glm-5-reasoning",
        "model": "GLM-5 (Reasoning)",
        "creator": "Z.AI",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 60.55,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 49.04,
          "upper": 72.07
        },
        "rankingEligible": true,
        "overallRank": 67,
        "url": "https://benchlm.ai/models/glm-5-reasoning",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-reasoning.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 60.55,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.450000000000003,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-glm-5-turbo",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-glm-5-turbo",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-glm-5-turbo.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "glm-5-turbo",
        "canonicalModelKey": "glm-5-turbo",
        "model": "GLM-5-Turbo",
        "creator": "Z.AI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "200K",
        "contextWindowTokens": 200000,
        "displayScore": 65.82,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 54.91,
          "upper": 76.74
        },
        "rankingEligible": true,
        "overallRank": 33,
        "url": "https://benchlm.ai/models/glm-5-turbo",
        "markdownUrl": "https://benchlm.ai/md/models/glm-5-turbo.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 65.82,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 20.180000000000007,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 1,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 5
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-qwen3-5-397b-reasoning",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-qwen3-5-397b-reasoning",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-qwen3-5-397b-reasoning.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "qwen3-5-397b-reasoning",
        "canonicalModelKey": "qwen3-5-397b-reasoning",
        "model": "Qwen3.5 397B (Reasoning)",
        "creator": "Alibaba",
        "sourceType": "Open Weight",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 60.27,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.76,
          "upper": 71.78
        },
        "rankingEligible": true,
        "overallRank": 68,
        "url": "https://benchlm.ai/models/qwen3-5-397b-reasoning",
        "markdownUrl": "https://benchlm.ai/md/models/qwen3-5-397b-reasoning.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 60.27,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 25.729999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-mimo-v2-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-mimo-v2-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-mimo-v2-pro.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "mimo-v2-pro",
        "canonicalModelKey": "mimo-v2-pro",
        "model": "MiMo-V2-Pro",
        "creator": "Xiaomi",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M",
        "contextWindowTokens": 1000000,
        "displayScore": 66.65,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 57.84,
          "upper": 75.46
        },
        "rankingEligible": true,
        "overallRank": 30,
        "url": "https://benchlm.ai/models/mimo-v2-pro",
        "markdownUrl": "https://benchlm.ai/md/models/mimo-v2-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 66.65,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 19.349999999999994,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 4,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 7
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": 78,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-2-instant",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-2-instant",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-2-instant.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-5-2-instant",
        "canonicalModelKey": "gpt-5-2-instant",
        "model": "GPT-5.2 Instant",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "128K",
        "contextWindowTokens": 128000,
        "displayScore": 59.77,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.26,
          "upper": 71.29
        },
        "rankingEligible": true,
        "overallRank": 72,
        "url": "https://benchlm.ai/models/gpt-5-2-instant",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-2-instant.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 59.77,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.229999999999997,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-2-pro",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-2-pro",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-2-pro.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-5-2-pro",
        "canonicalModelKey": "gpt-5-2-pro",
        "model": "GPT-5.2 Pro",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "400K",
        "contextWindowTokens": 400000,
        "displayScore": 67.19,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "supported",
        "scoreInterval90": {
          "lower": 56.87,
          "upper": 77.52
        },
        "rankingEligible": true,
        "overallRank": 27,
        "url": "https://benchlm.ai/models/gpt-5-2-pro",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-2-pro.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 67.19,
      "evidenceStatusA": null,
      "evidenceStatusB": "supported",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 18.810000000000002,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    },
    {
      "slug": "claude-mythos-5-vs-gpt-5-3-instant",
      "url": "https://benchlm.ai/compare/claude-mythos-5-vs-gpt-5-3-instant",
      "markdownUrl": "https://benchlm.ai/md/compare/claude-mythos-5-vs-gpt-5-3-instant.md",
      "modelA": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "modelB": {
        "slug": "gpt-5-3-instant",
        "canonicalModelKey": "gpt-5-3-instant",
        "model": "GPT-5.3 Instant",
        "creator": "OpenAI",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "400K",
        "contextWindowTokens": 400000,
        "displayScore": 59.67,
        "provisionalDisplayScore": 0,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": "estimated",
        "scoreInterval90": {
          "lower": 48.15,
          "upper": 71.18
        },
        "rankingEligible": true,
        "overallRank": 75,
        "url": "https://benchlm.ai/models/gpt-5-3-instant",
        "markdownUrl": "https://benchlm.ai/md/models/gpt-5-3-instant.md"
      },
      "rankingMode": "bench-align-v5",
      "scoreA": 86,
      "scoreB": 59.67,
      "evidenceStatusA": null,
      "evidenceStatusB": "estimated",
      "overallWinner": "A",
      "winner": {
        "slug": "claude-mythos-5",
        "canonicalModelKey": "claude-mythos-5",
        "model": "Claude Mythos 5",
        "creator": "Anthropic",
        "sourceType": "Proprietary",
        "reasoningType": "Reasoning",
        "contextWindow": "1M+",
        "contextWindowTokens": 1000000,
        "displayScore": null,
        "provisionalDisplayScore": 86,
        "publicRankingMode": "bench-align-v5",
        "evidenceStatus": null,
        "scoreInterval90": null,
        "rankingEligible": false,
        "overallRank": null,
        "url": "https://benchlm.ai/models/claude-mythos-5",
        "markdownUrl": "https://benchlm.ai/md/models/claude-mythos-5.md"
      },
      "scoreDiff": 26.33,
      "winsA": 0,
      "winsB": 0,
      "comparableCategoryCount": 0,
      "benchmarkCountA": 15,
      "benchmarkCountB": 0,
      "categoryResults": {
        "agentic": {
          "categoryLabel": "Agentic",
          "avgA": 87,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 4
        },
        "coding": {
          "categoryLabel": "Coding",
          "avgA": 89.7,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "multimodalGrounded": {
          "categoryLabel": "Multimodal & Grounded",
          "avgA": 93.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "reasoning": {
          "categoryLabel": "Reasoning",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "knowledge": {
          "categoryLabel": "Knowledge",
          "avgA": 68.5,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 3
        },
        "instructionFollowing": {
          "categoryLabel": "Instruction Following",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 0
        },
        "multilingual": {
          "categoryLabel": "Multilingual",
          "avgA": null,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        },
        "math": {
          "categoryLabel": "Mathematics",
          "avgA": 97.6,
          "avgB": null,
          "winner": null,
          "benchmarkCount": 1
        }
      }
    }
  ]
}
