Eğitim yöntemleri
DMind'ın modelleri iki özgün eğitim yöntemini (HPS ve C³-SFT), SFT, RLHF, LoRA ve distilasyon gibi standart yöntemlerle birleştirir. Bu sayfa her birini kısaca ele alır ve hangi modelin ne kullandığını belirtir.
Temel modeller
DMind-3
21B
gpt-oss-20b
ChatGPT
Sistemik risk, zincirler arası anlatılar, kurumsal araştırma ve ajan orkestrasyonu için bulut ve kurumsal VPC makro strateji finans motoru.
DMind-3
4B
Qwen
Yerel finansal modelleme ve strateji akıl yürütme modeli. Gizlilik öncelikli, çevrimdışı kullanılabilir, cihaz üzerinde derin akıl yürütme sunar.
DMind-3
270M
Gemini
Cüzdan ve DEX niyet tanıma ve işlev çağırma için cihaz üzerinde. SEARCH_TOKEN ve EXECUTE_SWAP'i, çoklu zinciri ve Çince/İngilizce niyetleri destekler.
DMind-2
107B
GLM-4.5-Air
GLM
Amiral gemisi kripto yatırım analizi modeli. Kurumsal danışmanlık ve kurumsal analiz için, makro trendleri zincir üstü davranış üzerinden kapsar.
DMind-2
4B
Qwen3-4B-Thinking-2507
Qwen
Yerel ve uç dağıtım, gizlilik ve düşük gecikmeli kullanım için hafif kripto yatırım analizi modeli.
DMind-1
33B
Qwen3-32B
Qwen
DeFi, token ekonomisi, yönetişim ve akıllı sözleşme Soru-Cevap ve akıl yürütme için Web3 uzman modeli.
DMind-1
15B
Qwen3-14B
Qwen
DMind-1'in hafifletilmiş damıtılmış sürümü. Düşük gecikmeli gerçek zamanlı Soru-Cevap, zincir üstü analiz ve hafif ajanlar için uygundur.
DMind modellerini kullanmak, hem DMind'in Model Sözleşmesine hem de temel modelin orijinal lisansına uymayı gerektirir.
Standart yöntemler
Gözetimli ince ayar (SFT)
Temel yöntem. Soruları referans cevaplarla eşleştirir ve modeli bunlara uyacak şekilde eğitir. DMind-1'in ilk eğitim aşaması SFT kullanır.
LoRA (Düşük Dereceli Uyarlama)
SFT yapmak için parametre açısından verimli bir yol. Modelin tüm parametrelerini güncellemek yerine, LoRA her katmana küçük bir düşük dereceli matris çifti ekler ve yalnızca bunları eğitir. Bu, eğitim maliyetini bir mertebe veya daha fazla azaltır. DMind-1, SFT için LoRA kullanır. Benchmark makalesindeki kontrollü deneyler de 16 rank ve 32 alpha ile LoRA kullanır.
İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF) ve PPO
İnsan geri bildiriminden pekiştirmeli öğrenme. Önce, insan tercih verileri üzerinde bir ödül modeli eğitin (bu soru için Cevap A, Cevap B'den daha iyidir). Ardından bu ödül modelini, ana modeli PPO (Proximal Policy Optimization) ile optimize etmek için bir eğitim sinyali olarak kullanın; aynı teknik GPT-3'ü ChatGPT'ye dönüştürmek için kullanıldı. DMind-1'in ikinci eğitim aşaması bu çifti kullanır.
Bilgi damıtma
Küçük bir öğrenci model, büyük bir öğretmen modelden öğrenir. DMind-1-mini, çift öğretmenden damıtılmıştır: DMind-1'in kendisi ve genel bir SOTA model (çıktılarını Web3 bağlamlarına hizalamak için DMind'in DeepResearch çerçevesinden geçirilir). Damıtma üç düzeyde çalışır. Öğrenci, öğretmenin nihai çıktılarıyla eşleşir, her token üzerindeki tam olasılık dağılımını eşleştirir ve ara katman temsillerini hizalar.
DMind'in iki özgün yöntemi
HPS (Hiyerarşik Öngörüsel Sentez)
DMind-3 (21B) arkasındaki eğitim amacı. HPS, Oracle'a girdilerin katmanlı bir yapısı boyunca akıl yürütmeyi öğretir. En altta belirli işlemler ve sözleşme çağrıları gibi ham zincir üstü olaylar vardır. Ortada birleştirilmiş piyasa göstergeleri vardır. En üstte Fed politikası, TÜFE ve jeopolitik olaylar gibi makro sinyaller vardır.
Her girdi modu için model, bir sonraki küresel piyasa durumunu tahmin etmeyi öğrenir. Eğitim kaybı, çok modlu ağırlıklı log-olasılıkla, temel modelin parametrelerinden çok fazla sapmayı cezalandıran bir düzenlileştirme terimini birleştirir. Düzenlileştirme, felaket düzeyinde unutmayı önlemek içindir; böylece model genel dil yeteneğini kaybetmeden finansta uzmanlaşabilir.
HPS ayrıca Oracle'a iki modlu bir çıkarım geçişi verir. Standart mod doğrudan bir yanıt döndürür. Özel bir [STRATEGY] belirteci modeli stratejik moda geçirir; burada yanıt vermeden önce risk yollarını da değerlendirir ve tarihsel olarak benzer senaryoları getirir. Hızlı ve yavaş düşünme, çağıran tarafından kontrol edilir.
C³-SFT (Karşıt Zincir-Düzeltme SFT)
DMind-3-Mini (4B) arkasındaki eğitim yöntemi. C³-SFT tek bir sorunun etrafında kurulur. Yanlış olduğunu güvenle söyleyen küçük bir model, belirsizliği kabul eden bir modelden daha tehlikelidir.
Standart SFT, bir modele bir soru verildiğinde doğru bir cevap üretmeyi öğretir. C³-SFT, eğitim verisini dört adımlı zincirlere dönüştürür. Zincir soruyla başlar, ardından olası ama kusurlu bir ilk cevap gelir, sonra ilk cevabın neyi gözden kaçırdığını belirten açık bir eleştiri gelir (örneğin, dikkate alınmamış bir oracle manipülasyon riski), ardından eleştiriyi ele alan düzeltilmiş bir cevap gelir.
Model bu dört adımın hepsini üretmeyi öğrenir. Çıkarım sırasında bu, kendini sorgulama davranışına dönüşür. Model bir ilk cevap verir, kendini eleştirir ve revize eder. Adındaki "karşıt" kısmı, eğitim sırasında modele hem doğru hem de tipik yanlış cevapları göstermesinden gelir; böylece arıza modlarının belirli şeklini öğrenir.
Bu, daha büyük modellerin ayrı düşünme belirteçleriyle uyguladığı Sistem-2 akıl yürütme yaklaşımının hafif bir sürümüdür. Bunu doğrudan bir 4B modele koymak, Mini'nin bir kullanıcının cihazında çalışırken bir güvenlik ağı korumasını sağlar.
Eğitim verisi
DMind-1'in eğitim verisi, DeFi, token ekonomisi, yönetişim, akıllı sözleşmeler, Katman-1/2 mimarisi, NFT'ler, DAO'lar ve güvenlik genelinde 32,7 GB Web3 kaynak belgesinden damıtılmış, uzmanlarca kürate edilmiş 13.276 bilgi öğesidir.
DMind-3'ün eğitim verisi daha büyük ve daha yapılandırılmıştır:
Kurumsal alfa araştırması
35%
Nedensel bir model üzerinden ayrıştırılmış, kriptoya özgü fon ve geleneksel finans raporları
Küresel makroekonomik veriler
25%
FRED, Dünya Bankası, IMF'den zaman serileri, zincir üstü göstergelerle birleştirilmiş
Zincirler arası endeks verileri
20%
Başlıca EVM zincirleri, Solana, Cosmos genelinde tam işlem, durum ve günlük geçmişi
Post-mortemler ve denetimler
10%
Sistemik arızalar, ekonomik saldırılar, protokol hackleri; erken sinyaller ve bulaşma yollarına odaklanır
Jeopolitika ve düzenleme
10%
Dijital varlıkları etkileyen küresel düzenleyici değişiklikler, politika önerileri, jeopolitik olaylar
Toplam: 500.000+ üzeri kürate edilmiş belge, ayrıca çok terabaytlık zincir üstü yapılandırılmış veri.
Tüm eğitim verileri kazınmak yerine alan uzmanları tarafından incelenir. Seçim kriterleri model kartlarında ve makalelerde yayımlanır.
Son güncelleme
Bu yararlı oldu mu?

