For the complete documentation index, see llms.txt. This page is also available as Markdown.

Benchmark DMind

DMind Benchmark es un conjunto de evaluación para la comprensión de Web3 en modelos de lenguaje grandes. Fue aceptado en la pista de Datasets & Benchmarks de KDD 2026 entre 513 propuestas (tasa de aceptación de alrededor del 29%) y se presentará en la conferencia principal en Jeju, Corea del Sur, en agosto de 2026.

El conjunto de datos es abierto y se ha descargado más de 13.000 veces desde Hugging Face. Es el artefacto más utilizado en el ecosistema DMind.

Qué cubre

1.917 preguntas revisadas por expertos en 9 subdominios de Web3:

  1. Conceptos fundamentales de blockchain: hashing, árboles de Merkle, consenso, PoW/PoS, estructura de bloques, bifurcaciones.

  2. Infraestructura de blockchain: Capa 1 frente a Capa 2 (Optimistic vs ZK Rollups), puentes, arquitectura de nodos, RPC.

  3. Contratos inteligentes: Solidity, mecánica de llamadas, almacenamiento, bytecode de la EVM, patrones de actualización.

  4. Mecanismos DeFi: matemáticas de AMM, modelos de tasas de préstamo, lógica de liquidación, fijación de precios de derivados.

  5. DAO: tokens de gobernanza, votación, propuestas, quórum, timelocks.

  6. NFT: estándares ERC-721/1155, mecánica de regalías, precio mínimo, préstamos de NFT.

  7. Economía de tokens: emisión, vesting, quema, alineación de incentivos, descubrimiento de precios.

  8. Conceptos meme: términos culturales específicos de cripto y dinámicas de tokens meme.

  9. Vulnerabilidades de seguridad: reentrancia, ataques de flash loan, manipulación de oráculos, repetición de firmas, hallazgos comunes de auditoría.

Formatos de pregunta

El benchmark utiliza dos tipos de preguntas. Las preguntas de opción múltiple evalúan la memorización factual. Las tareas de respuesta abierta incluyen la depuración de contratos inteligentes, donde el modelo tiene que encontrar la vulnerabilidad en un fragmento de Solidity, y el razonamiento numérico on-chain, donde se le da al modelo el estado de un pool de AMM y tiene que calcular la ganancia de un vector de ataque específico.

Las tareas de respuesta abierta son deliberadamente más difíciles que las de opción múltiple. Un modelo puede resolver las de opción múltiple mediante reconocimiento de patrones. El razonamiento numérico y el análisis de código requieren realmente resolver el problema.

Lo que encontró el artículo

La versión más reciente del benchmark ha evaluado 31 modelos grandes principales, incluidos GPT-5, Claude Sonnet 4.5, DeepSeek, Gemini, Grok y la serie Qwen. Destacan tres hallazgos.

Los fundamentos están en gran medida resueltos, la profundidad no

Todos los modelos importantes rinden razonablemente bien en los fundamentos de blockchain, el tipo de contenido que aparece en Wikipedia. El rendimiento cae bruscamente en economía de tokens, conceptos meme y seguridad. Estas son las áreas en las que la experiencia en Web3 realmente importa, y donde los modelos de propósito general tienden a inventar respuestas plausibles pero incorrectas.

El costo y la precisión no evolucionan juntos

Cuando se representa la precisión frente al costo por token, aparece una clara frontera de Pareto. La serie GPT-5 se sitúa en el extremo de mayor precisión. Algunos modelos abiertos, incluidos GPT-OSS-120B, Kimi K2 y Qwen3-235B Thinking, ofrecen mejor valor en la zona media. Varios modelos cerrados conocidos resultan ser tanto caros como más débiles que otras alternativas específicamente en tareas de Web3. El artículo publica todos los datos para que las cifras puedan reproducirse.

El ajuste fino con más datos no cierra la brecha

El artículo realiza un experimento controlado. Toma tres modelos base (QwQ-32B, Qwen3-32B, DeepSeek-R1-Distill-Llama-70B), ajusta cada uno con fine-tuning sobre el conjunto completo de datos del benchmark usando LoRA, y mide la mejora. Las curvas de aprendizaje se mantienen poco pronunciadas. Alimentar más datos no desbloquea el razonamiento Web3. El verdadero cuello de botella es la inferencia multietapa, la asociación entre conceptos y la comprensión de un mercado que cambia con el tiempo. Este es el argumento a favor de nuevos métodos de entrenamiento en lugar de conjuntos de entrenamiento más grandes, y la razón por la que DMind invirtió en HPS y C³-SFT (véase Métodos de entrenamiento).

Dónde leerlo

Última actualización

¿Te fue útil?