2026 AYT · Matematik

Yöntem notları

net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Matematik neti × 3

Lider model
GPT-5.6 Luna (xhigh)213,25Matematik Puanı
Model
74
Soru
39
Model–soru yanıtı
2.886
Ölçülen toplam maliyet
≈$44.47
Koşu tarihi
31 Temmuz 2026
SıraModelMatematik PuanıNetMaliyetToken
#1GPT-5.6 Luna (xhigh)213,2537,75$0.0469.598
#2GPT-5.6 Luna (max)213,2537,75$0.0476.098
#3Ring-2.6-1T (high)213,2537,75$0.0477.168
#4Ring-2.6-1T (xhigh)213,2537,75$0.06105.773
#5GPT-5.6 Terra (low)213,2537,75$0.1024.333

Tüm benchmark analizi

Tüm sonuçlar

Liderlik tablosu

Başlıkları seçerek sıralamayı değiştirebilirsiniz; bilinmeyen değerler her zaman sona gider.

Model
1GPT-5.6 Luna (xhigh)OpenAI213,2537,7537,75$0.0469.598
2GPT-5.6 Luna (max)OpenAI213,2537,7537,75$0.0476.098
3Ring-2.6-1T (high)Inclusion AI213,2537,7537,75$0.0477.168
4Ring-2.6-1T (xhigh)Inclusion AI213,2537,7537,75$0.06105.773
5GPT-5.6 Terra (low)OpenAI213,2537,7537,75$0.1024.333
6GPT-5.6 Terra (high)OpenAI213,2537,7537,75$0.1126.749
7GPT-5.6 Terra (xhigh)OpenAI213,2537,7537,75$0.1431.086
8Tencent Hy3 (high)Tencent213,2537,7537,75≈$0.15291.328
9Muse Glimmer 30B (high)Meta213,2537,7537,75$0.16113.764
10Thinky Inkling (medium)Thinking Machines Lab213,2537,7537,75$0.2569.985
11Qwen3.7 PlusAlibaba Qwen213,2537,7537,75$0.26209.436
12Claude Opus 5 (low)Anthropic213,2537,7537,75$0.3123.735
13GPT-5.6 Terra (max)OpenAI213,2537,7537,75$0.3362.695
14Gemini 3.6 Flash (low)Google213,2537,7537,75$0.4060.641
15Claude Opus 5 (medium)Anthropic213,2537,7537,75$0.4730.188
16Claude Sonnet 5 (medium)Anthropic213,2537,7537,75$0.4859.798
17GPT-5.6 Sol (low)OpenAI213,2537,7537,75$0.5124.667
18Grok 4.5 (medium)xAI213,2537,7537,75$0.5298.216
19GPT-5.6 Sol (medium)OpenAI213,2537,7537,75$0.5325.242
20Claude Fable 5 (low)Anthropic213,2537,7537,75$0.5522.573
21Nemotron 3 Ultra (high)NVIDIA213,2537,7537,75$0.56164.373
22Nemotron 3 Ultra (medium)NVIDIA213,2537,7537,75$0.60173.901
23Grok 4.5 (high)xAI213,2537,7537,75$0.60111.954
24Gemini 3.1 Pro (low)Google213,2537,7537,75$0.6158.350
25GPT-5.6 Sol (high)OpenAI213,2537,7537,75$0.6529.338
26Qwen3.7 MaxAlibaba Qwen213,2537,7537,75$0.72168.909
27Thinky Inkling (max)Thinking Machines Lab213,2537,7537,75$0.73187.437
28GPT-5.6 Sol (xhigh)OpenAI213,2537,7537,75$0.7332.011
29Claude Opus 5 (high)Anthropic213,2537,7537,75$0.7842.601
30Claude Sonnet 5 (high)Anthropic213,2537,7537,75$0.8899.603
31Gemini 3.6 Flash (high)Google213,2537,7537,75$0.90127.527
32Gemini 3.1 Pro (medium)Google213,2537,7537,75$0.9283.818
33Claude Opus 5 (xhigh)Anthropic213,2537,7537,75$0.9649.816
34Claude Fable 5 (medium)Anthropic213,2537,7537,75$0.9730.964
35GPT-5.6 Sol (max)OpenAI213,2537,7537,75$1.0642.982
36Claude Sonnet 5 (xhigh)Anthropic213,2537,7537,75$1.21132.384
37Claude Opus 5 (max)Anthropic213,2537,7537,75$1.2862.493
38Claude Fable 5 (high)Anthropic213,2537,7537,75$1.4139.748
39Gemini 3.1 Pro (high)Google213,2537,7537,75$1.49131.297
40Claude Fable 5 (xhigh)Anthropic213,2537,7537,75$2.0652.659
41Claude Fable 5 (max)Anthropic213,2537,7537,75$3.3478.199
42Claude Sonnet 5 (max)Anthropic213,2537,7537,75$4.06417.489
43OpenRouter FusionOpenRouter213,2537,7537,75n/a94.666
44GPT-5.6 Luna (medium)OpenAI209,5036,5036,50$0.0233.326
45Tencent Hy3 (low)Tencent209,5036,5036,50≈$0.0598.707
46Thinky Inkling (minimal)Thinking Machines Lab209,5036,5036,50$0.0929.026
47MiMo V2.5 ProXiaomi209,5036,5036,50$0.10116.515
48DeepSeek V4 Pro (high)DeepSeek209,5036,5036,50≈$0.11135.789
49GPT-5.6 Terra (medium)OpenAI209,5036,5036,50$0.1430.237
50DeepSeek V4 Flash (xhigh)DeepSeek209,5036,5036,50$0.15554.206
51Gemini 3.6 Flash (minimal)Google209,5036,5036,50$0.2236.516
52Claude Sonnet 5 (low)Anthropic209,5036,5036,50$0.2637.093
53Grok 4.5 (low)xAI209,5036,5036,50$0.3265.065
54Thinky Inkling (high)Thinking Machines Lab209,5036,5036,50$0.42110.403
55LongCat 2.0Meituan209,5036,5036,50$0.43370.865
56Kimi K3 (low)Moonshot AI209,5036,5036,50$0.5749.585
57Kimi K3 (high)Moonshot AI209,5036,5036,50$0.7461.432
58Gemini 3.6 Flash (medium)Google209,5036,5036,50$0.80113.281
59Gemma 4 31BGoogle205,7535,2535,25≈$0.0145.262
60DeepSeek V4 Pro (xhigh)DeepSeek205,7535,2535,25≈$0.23266.260
61GLM 5.2 (xhigh)Z.ai205,7535,2535,25≈$1.47398.849
62Kimi K3 (max)Moonshot AI205,7535,2535,25$3.13220.059
63GPT-5.6 Luna (high)OpenAI202,0034,0034,00$0.0350.682
64Thinky Inkling (low)Thinking Machines Lab202,0034,0034,00$0.0825.949
65DeepSeek V4 Flash (high)DeepSeek202,0034,0034,00$0.15535.441
66GPT-5.6 Sol (none)OpenAI202,0034,0034,00$0.3318.497
67MiniMax M3MiniMax202,0034,0034,00$0.59505.117
68Qwen3.6 27BAlibaba Qwen202,0034,0034,00≈$0.66336.631
69GLM 5.2 (high)Z.ai202,0034,0034,00≈$1.21330.631
70Tencent Hy3 (none)Tencent198,2532,7532,75≈$0.0131.729
71GPT-5.6 Luna (low)OpenAI198,2532,7532,75$0.0235.050
72Thinky Inkling (none)Thinking Machines Lab187,0029,0029,00$0.1235.568
73GPT-5.6 Luna (none)OpenAI179,5026,5026,50$0.0120.011
74GPT-5.6 Terra (none)OpenAI179,5026,5026,50$0.0617.009

Cevap kâğıdı

dolgu = soruyu doğru çözen model oranı
  • 1MAT-1: 74 modelin 72 tanesi doğru çözdü
  • 2MAT-2: 74 modelin 74 tanesi doğru çözdü
  • 3MAT-3: 74 modelin 74 tanesi doğru çözdü
  • 4MAT-4: 74 modelin 61 tanesi doğru çözdü
  • 5MAT-5: 74 modelin 74 tanesi doğru çözdü
  • 6MAT-6: 74 modelin 74 tanesi doğru çözdü
  • 7MAT-7: 74 modelin 74 tanesi doğru çözdü
  • 8MAT-8: 74 modelin 73 tanesi doğru çözdü
  • 9MAT-9: 74 modelin 0 tanesi doğru çözdü
  • 10MAT-10: 74 modelin 73 tanesi doğru çözdü
  • 11MAT-11: 74 modelin 72 tanesi doğru çözdü
  • 12MAT-12: 74 modelin 74 tanesi doğru çözdü
  • 13MAT-13: 74 modelin 74 tanesi doğru çözdü
  • 14MAT-14: 74 modelin 74 tanesi doğru çözdü
  • 15MAT-15: 74 modelin 67 tanesi doğru çözdü
  • 16MAT-16: 74 modelin 74 tanesi doğru çözdü
  • 17MAT-17: 74 modelin 72 tanesi doğru çözdü
  • 18MAT-18: 74 modelin 72 tanesi doğru çözdü
  • 19MAT-19: 74 modelin 74 tanesi doğru çözdü
  • 20MAT-20: ÖSYM tarafından iptal edildi, puanlamaya girmez
  • 21MAT-21: 74 modelin 73 tanesi doğru çözdü
  • 22MAT-22: 74 modelin 73 tanesi doğru çözdü
  • 23MAT-23: 74 modelin 68 tanesi doğru çözdü
  • 24MAT-24: 74 modelin 74 tanesi doğru çözdü
  • 25MAT-25: 74 modelin 74 tanesi doğru çözdü
  • 26MAT-26: 74 modelin 71 tanesi doğru çözdü
  • 27MAT-27: 74 modelin 74 tanesi doğru çözdü
  • 28MAT-28: 74 modelin 74 tanesi doğru çözdü
  • 29MAT-29: 74 modelin 72 tanesi doğru çözdü
  • 30MAT-30: 74 modelin 74 tanesi doğru çözdü
  • 31MAT-31: 74 modelin 73 tanesi doğru çözdü
  • 32MAT-32: 74 modelin 67 tanesi doğru çözdü
  • 33MAT-33: 74 modelin 71 tanesi doğru çözdü
  • 34MAT-34: 74 modelin 68 tanesi doğru çözdü
  • 35MAT-35: 74 modelin 68 tanesi doğru çözdü
  • 36MAT-36: 74 modelin 74 tanesi doğru çözdü
  • 37MAT-37: 74 modelin 66 tanesi doğru çözdü
  • 38MAT-38: 74 modelin 72 tanesi doğru çözdü
  • 39MAT-39: 74 modelin 74 tanesi doğru çözdü
  • 40MAT-40: 74 modelin 73 tanesi doğru çözdü
herkes çözdü (17 soru) ayırt eden soru ÖSYM iptali (20)

Koşudan çıkanlar

Üç bulgu

  • Bulgu · Zirve

    Aynı zirve, farklı maliyet

    GPT-5.6 Luna (xhigh), GPT-5.6 Luna (max), Ring-2.6-1T (high) ve 40 yapılandırma daha, 213,25 puanla zirveyi paylaşıyor. Zirve grubundaki ölçülen maliyet $0.04 (GPT-5.6 Luna (xhigh)) ile $4.06 (Claude Sonnet 5 (max)) arasında. Ayrıca zirvedeki 1 modelin maliyeti bilinmiyor.

  • Bulgu · Bölümler

    Tam net tablosu

    Matematik bölümünde tam nete ulaşan model: 0/74.

  • Bulgu · Ölçüm sınırı

    Bilinmeyen değer, sıfır değildir

    Toplam 10 modelde en az bir ölçüm açıklaması var. Maliyet: 1 bilinmiyor, 9 yaklaşık.

Okuma notları

Kapsam ve ölçüm sınırları

  • Puanlama: net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Matematik neti × 3
  • Sıralama: Yuvarlanmamış puan yüksekten düşüğe sıralanır. Eşit puanda bilinen daha düşük maliyet önce gelir; maliyeti bilinmeyenler aynı puan grubunun sonuna gider. Tam eşitlikte kaynak sırası korunur.
  • 1 modelin maliyeti bilinmediği için maliyet analizlerinden çıkarılır; 9 modelin maliyeti yaklaşık değer taşır.
  • Model notları:
    • Tencent Hy3 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • Muse Glimmer 30B (high): Koşu ayarlarındaki 65.536 istenen tavandır; efektif tavan 32.768'dir. Diğer varyantlar 131.072 ile koştu, ancak modelin bağlamı 131.072 olduğundan genel tavan gönderilemezdi. Pinlenen Together endpoint'i ilan etmediği bir sınırla talebi 32.768'de kesiyor. 2026-08-12 ölçümünde bu tavanda hiçbir yanıt kesilmedi.
    • Tencent Hy3 (low): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • DeepSeek V4 Pro (high): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
    • Gemma 4 31B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,2 katıydı.
    • DeepSeek V4 Pro (xhigh): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
    • GLM 5.2 (xhigh): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • Qwen3.6 27B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,8 katıydı.
    • GLM 5.2 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • Tencent Hy3 (none): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.