Changelog

New model additions and benchmark updates for Leberkaesbench.

This is the running log for new models and notable benchmark updates.

03.08.2026

  • Added qwen/qwen3.8-max

31.07.2026

  • Added deepseek/deepseek-v4-flash-0731

28.07.2026

  • Added anthropic/claude-opus-5

21.07.2026

  • Added poolside/laguna-s-2.1
  • Added meituan/longcat-2.0
  • Added google/gemini-3.5-flash-lite
  • Added google/gemini-3.6-flash

18.07.2026

  • Added thinkingmachines/inkling

16.07.2026

  • Added moonshotai/kimi-k3

15.07.2026

  • Added google/gemini-3.1-pro-preview

14.07.2026

  • Added kwaipilot/kat-coder-air-v2.5
  • Added kwaipilot/kat-coder-pro-v2.5

09.07.2026

  • Added openai/gpt-5.6-luna
  • Added openai/gpt-5.6-luna-pro
  • Added openai/gpt-5.6-sol
  • Added openai/gpt-5.6-sol-pro
  • Added openai/gpt-5.6-terra
  • Added openai/gpt-5.6-terra-pro

Can’t test Facebook’s Muse Spark 1.1 model 😢

08.07.2026

  • Added poolside/laguna-xs-2.1
  • Added tencent/hy3
  • Added x-ai/grok-4.5

01.07.2026

  • Initial public release