For the complete documentation index, see llms.txt. This page is also available as Markdown.

DMind Kıyaslaması

DMind Benchmark, büyük dil modellerinde Web3 anlayışını değerlendirmek için bir değerlendirme paketidir. 513 başvuru arasından KDD 2026 Datasets & Benchmarks Track’e kabul edildi (kabul oranı yaklaşık %29) ve Ağustos 2026’da Güney Kore’nin Jeju kentinde düzenlenecek ana konferansta sunulacaktır.

Veri seti açıktır ve Hugging Face’ten 13.000’den fazla kez indirilmiştir. DMind ekosisteminde en çok kullanılan yapıt budur.

Neleri kapsıyor

9 Web3 alt alanında 1.917 uzman tarafından incelenmiş soru:

  1. Temel blockchain kavramları: hashing, Merkle ağaçları, konsensüs, PoW/PoS, blok yapısı, çatallanma.

  2. Blockchain altyapısı: Katman-1 ve Katman-2 (Optimistic ve ZK Rollup’lar), köprüler, düğüm mimarisi, RPC.

  3. Akıllı sözleşmeler: Solidity, çağrı mekanikleri, depolama, EVM bayt kodu, yükseltme kalıpları.

  4. DeFi mekanizmaları: AMM matematiği, borç verme faiz modelleri, tasfiye mantığı, türev fiyatlaması.

  5. DAO’lar: yönetişim token’ları, oylama, teklifler, yeter sayı, zaman kilitleri.

  6. NFT’ler: ERC-721/1155 standartları, telif mekanikleri, taban fiyatlandırma, NFT borç verme.

  7. Token ekonomisi: ihraç, hak ediş, yakma, teşvik uyumu, fiyat keşfi.

  8. Meme kavramları: kriptoya özgü kültürel terimler ve meme-token dinamikleri.

  9. Güvenlik açıkları: yeniden giriş, flash loan saldırıları, oracle manipülasyonu, imza tekrarı, yaygın denetim bulguları.

Soru formatları

Karşılaştırma ölçütü iki tür soru kullanır. Çoktan seçmeli sorular olgusal hatırlamayı test eder. Açık uçlu görevler arasında, modelin bir Solidity parçasındaki açığı bulması gereken akıllı sözleşme hata ayıklama ve modele bir AMM havuz durumu verilip belirli bir saldırı vektöründen elde edilen kârı hesaplaması gereken zincir üstü sayısal akıl yürütme yer alır.

Açık uçlu görevler, bilinçli olarak çoktan seçmeli sorulardan daha zordur. Bir model çoktan seçmeli sorularda örüntü eşleştirme ile ilerleyebilir. Sayısal akıl yürütme ve kod analizi, problemi gerçekten çözmeyi gerektirir.

Makalede ne bulundu

Karşılaştırma ölçütünün en son sürümü, GPT-5, Claude Sonnet 4.5, DeepSeek, Gemini, Grok ve Qwen serisi dahil 31 ana akım büyük modeli değerlendirdi. Üç bulgu öne çıkıyor.

Temeller büyük ölçüde çözüldü, derinlik ise çözülemedi

Her büyük model blockchain temellerinde, Wikipedia’da görülen türde içeriklerde, oldukça iyi performans gösteriyor. Token ekonomisi, meme kavramları ve güvenlikte performans keskin biçimde düşüyor. Bunlar, Web3 uzmanlığının gerçekten önemli olduğu ve genel amaçlı modellerin genellikle kulağa makul gelen ama yanlış cevaplar uydurduğu alanlardır.

Maliyet ve doğruluk birlikte hareket etmiyor

Doğruluğu token başına maliyetle karşılaştırdığınızda, belirgin bir Pareto sınırı görülür. GPT-5 serisi yüksek doğruluk ucunda yer alır. GPT-OSS-120B, Kimi K2 ve Qwen3-235B Thinking dahil bazı açık modeller orta kısımda daha iyi değer sunar. Bazı bilinen kapalı modellerin, özellikle Web3 görevlerinde, hem pahalı hem de alternatiflerden daha zayıf olduğu ortaya çıkar. Makale, sayıların yeniden üretilebilmesi için tüm verileri yayımlıyor.

Daha fazla veriyle ince ayar yapmak farkı kapatmıyor

Makale kontrollü bir deney yürütüyor. Üç temel model alın (QwQ-32B, Qwen3-32B, DeepSeek-R1-Distill-Llama-70B), her birini LoRA ile tam karşılaştırma veri seti üzerinde ince ayar yapın ve iyileşmeyi ölçün. Öğrenme eğrileri sığ kalıyor. Daha fazla veri beslemek Web3 akıl yürütmesini açığa çıkarmıyor. Asıl darboğaz, çok adımlı çıkarım, kavramlar arası ilişkilendirme ve zaman içinde değişen bir piyasayı anlamaktır. Bu, daha büyük eğitim setleri yerine yeni eğitim yöntemleri için bir argümandır ve DMind’in HPS ve C³-SFT’ye yatırım yapmasının nedeni budur (bkz. Eğitim yöntemleri).

Nereden okunur

Son güncelleme

Bu yararlı oldu mu?