For the complete documentation index, see llms.txt. This page is also available as Markdown.

Eğitim yöntemleri

DMind'ın modelleri iki özgün eğitim yöntemini (HPS ve C³-SFT), SFT, RLHF, LoRA ve distilasyon gibi standart yöntemlerle birleştirir. Bu sayfa her birini kısaca ele alır ve hangi modelin ne kullandığını belirtir.

Temel modeller

Seri
Parametreler
Temel
Temel sağlayıcı
Rol

DMind-3

21B

gpt-oss-20b

ChatGPT

Sistemik risk, zincirler arası anlatılar, kurumsal araştırma ve ajan orkestrasyonu için bulut ve kurumsal VPC makro strateji finans motoru.

DMind-3

4B

Qwen3.5-4B

Qwen

Yerel finansal modelleme ve strateji akıl yürütme modeli. Gizlilik öncelikli, çevrimdışı kullanılabilir, cihaz üzerinde derin akıl yürütme sunar.

DMind-3

270M

functiongemma-270m-it

Gemini

Cüzdan ve DEX niyet tanıma ve işlev çağırma için cihaz üzerinde. SEARCH_TOKEN ve EXECUTE_SWAP'i, çoklu zinciri ve Çince/İngilizce niyetleri destekler.

DMind-2

107B

GLM-4.5-Air

GLM

Amiral gemisi kripto yatırım analizi modeli. Kurumsal danışmanlık ve kurumsal analiz için, makro trendleri zincir üstü davranış üzerinden kapsar.

DMind-2

4B

Qwen3-4B-Thinking-2507

Qwen

Yerel ve uç dağıtım, gizlilik ve düşük gecikmeli kullanım için hafif kripto yatırım analizi modeli.

DMind-1

33B

Qwen3-32B

Qwen

DeFi, token ekonomisi, yönetişim ve akıllı sözleşme Soru-Cevap ve akıl yürütme için Web3 uzman modeli.

DMind-1

15B

Qwen3-14B

Qwen

DMind-1'in hafifletilmiş damıtılmış sürümü. Düşük gecikmeli gerçek zamanlı Soru-Cevap, zincir üstü analiz ve hafif ajanlar için uygundur.

DMind modellerini kullanmak, hem DMind'in Model Sözleşmesine hem de temel modelin orijinal lisansına uymayı gerektirir.

Standart yöntemler

Gözetimli ince ayar (SFT)

Temel yöntem. Soruları referans cevaplarla eşleştirir ve modeli bunlara uyacak şekilde eğitir. DMind-1'in ilk eğitim aşaması SFT kullanır.

LoRA (Düşük Dereceli Uyarlama)

SFT yapmak için parametre açısından verimli bir yol. Modelin tüm parametrelerini güncellemek yerine, LoRA her katmana küçük bir düşük dereceli matris çifti ekler ve yalnızca bunları eğitir. Bu, eğitim maliyetini bir mertebe veya daha fazla azaltır. DMind-1, SFT için LoRA kullanır. Benchmark makalesindeki kontrollü deneyler de 16 rank ve 32 alpha ile LoRA kullanır.

İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF) ve PPO

İnsan geri bildiriminden pekiştirmeli öğrenme. Önce, insan tercih verileri üzerinde bir ödül modeli eğitin (bu soru için Cevap A, Cevap B'den daha iyidir). Ardından bu ödül modelini, ana modeli PPO (Proximal Policy Optimization) ile optimize etmek için bir eğitim sinyali olarak kullanın; aynı teknik GPT-3'ü ChatGPT'ye dönüştürmek için kullanıldı. DMind-1'in ikinci eğitim aşaması bu çifti kullanır.

Bilgi damıtma

Küçük bir öğrenci model, büyük bir öğretmen modelden öğrenir. DMind-1-mini, çift öğretmenden damıtılmıştır: DMind-1'in kendisi ve genel bir SOTA model (çıktılarını Web3 bağlamlarına hizalamak için DMind'in DeepResearch çerçevesinden geçirilir). Damıtma üç düzeyde çalışır. Öğrenci, öğretmenin nihai çıktılarıyla eşleşir, her token üzerindeki tam olasılık dağılımını eşleştirir ve ara katman temsillerini hizalar.

DMind'in iki özgün yöntemi

HPS (Hiyerarşik Öngörüsel Sentez)

DMind-3 (21B) arkasındaki eğitim amacı. HPS, Oracle'a girdilerin katmanlı bir yapısı boyunca akıl yürütmeyi öğretir. En altta belirli işlemler ve sözleşme çağrıları gibi ham zincir üstü olaylar vardır. Ortada birleştirilmiş piyasa göstergeleri vardır. En üstte Fed politikası, TÜFE ve jeopolitik olaylar gibi makro sinyaller vardır.

Her girdi modu için model, bir sonraki küresel piyasa durumunu tahmin etmeyi öğrenir. Eğitim kaybı, çok modlu ağırlıklı log-olasılıkla, temel modelin parametrelerinden çok fazla sapmayı cezalandıran bir düzenlileştirme terimini birleştirir. Düzenlileştirme, felaket düzeyinde unutmayı önlemek içindir; böylece model genel dil yeteneğini kaybetmeden finansta uzmanlaşabilir.

HPS ayrıca Oracle'a iki modlu bir çıkarım geçişi verir. Standart mod doğrudan bir yanıt döndürür. Özel bir [STRATEGY] belirteci modeli stratejik moda geçirir; burada yanıt vermeden önce risk yollarını da değerlendirir ve tarihsel olarak benzer senaryoları getirir. Hızlı ve yavaş düşünme, çağıran tarafından kontrol edilir.

C³-SFT (Karşıt Zincir-Düzeltme SFT)

DMind-3-Mini (4B) arkasındaki eğitim yöntemi. C³-SFT tek bir sorunun etrafında kurulur. Yanlış olduğunu güvenle söyleyen küçük bir model, belirsizliği kabul eden bir modelden daha tehlikelidir.

Standart SFT, bir modele bir soru verildiğinde doğru bir cevap üretmeyi öğretir. C³-SFT, eğitim verisini dört adımlı zincirlere dönüştürür. Zincir soruyla başlar, ardından olası ama kusurlu bir ilk cevap gelir, sonra ilk cevabın neyi gözden kaçırdığını belirten açık bir eleştiri gelir (örneğin, dikkate alınmamış bir oracle manipülasyon riski), ardından eleştiriyi ele alan düzeltilmiş bir cevap gelir.

Model bu dört adımın hepsini üretmeyi öğrenir. Çıkarım sırasında bu, kendini sorgulama davranışına dönüşür. Model bir ilk cevap verir, kendini eleştirir ve revize eder. Adındaki "karşıt" kısmı, eğitim sırasında modele hem doğru hem de tipik yanlış cevapları göstermesinden gelir; böylece arıza modlarının belirli şeklini öğrenir.

Bu, daha büyük modellerin ayrı düşünme belirteçleriyle uyguladığı Sistem-2 akıl yürütme yaklaşımının hafif bir sürümüdür. Bunu doğrudan bir 4B modele koymak, Mini'nin bir kullanıcının cihazında çalışırken bir güvenlik ağı korumasını sağlar.

Eğitim verisi

DMind-1'in eğitim verisi, DeFi, token ekonomisi, yönetişim, akıllı sözleşmeler, Katman-1/2 mimarisi, NFT'ler, DAO'lar ve güvenlik genelinde 32,7 GB Web3 kaynak belgesinden damıtılmış, uzmanlarca kürate edilmiş 13.276 bilgi öğesidir.

DMind-3'ün eğitim verisi daha büyük ve daha yapılandırılmıştır:

Kaynak
Pay
Nedir

Kurumsal alfa araştırması

35%

Nedensel bir model üzerinden ayrıştırılmış, kriptoya özgü fon ve geleneksel finans raporları

Küresel makroekonomik veriler

25%

FRED, Dünya Bankası, IMF'den zaman serileri, zincir üstü göstergelerle birleştirilmiş

Zincirler arası endeks verileri

20%

Başlıca EVM zincirleri, Solana, Cosmos genelinde tam işlem, durum ve günlük geçmişi

Post-mortemler ve denetimler

10%

Sistemik arızalar, ekonomik saldırılar, protokol hackleri; erken sinyaller ve bulaşma yollarına odaklanır

Jeopolitika ve düzenleme

10%

Dijital varlıkları etkileyen küresel düzenleyici değişiklikler, politika önerileri, jeopolitik olaylar

Toplam: 500.000+ üzeri kürate edilmiş belge, ayrıca çok terabaytlık zincir üstü yapılandırılmış veri.

Tüm eğitim verileri kazınmak yerine alan uzmanları tarafından incelenir. Seçim kriterleri model kartlarında ve makalelerde yayımlanır.

Son güncelleme

Bu yararlı oldu mu?