

Inkling es el primer modelo de pesos abiertos de Thinking Machines, un MoE de 975B con 41B de parámetros activos, 1M de contexto, razonamiento nativo en texto, imágenes y audio, y esfuerzo de pensamiento controlable. Ajústalo en Tinker o descarga los pesos con licencia Apache 2.0.
Loading comments…
Información del proyecto
Palabras clave del producto
Inkling es el primer modelo de pesos abiertos de Thinking Machines, publicado bajo la licencia Apache 2.0. Se trata de un transformador de Mezcla de Expertos (MoE) con 975 mil millones de parámetros totales y 41 mil millones de parámetros activos por paso hacia adelante. Inkling admite una ventana de contexto de hasta 1 millón de tokens y fue preentrenado con 45 billones de tokens que abarcan texto, imágenes, audio y video. Razona de forma nativa a través de estas modalidades y ofrece un esfuerzo de razonamiento controlable, lo que permite a los usuarios equilibrar el costo y el rendimiento. El modelo está disponible para ajuste fino en Tinker, y sus pesos completos se pueden descargar directamente.
Inkling utiliza una arquitectura de Mezcla de Expertos que activa solo una fracción de sus parámetros totales por token. Este diseño ofrece la capacidad de un modelo grande mientras mantiene la inferencia computacional eficiente y la latencia manejable.
El modelo admite hasta 1 millón de tokens de contexto, lo que lo hace adecuado para análisis de documentos largos, conversaciones extendidas y tareas que requieren razonamiento sobre grandes cantidades de información en una sola pasada.
Inkling fue preentrenado con texto, imágenes, audio y video, y razona de forma nativa a través de estas modalidades. No depende de codificadores o pipelines separados para diferentes tipos de entrada.
Los usuarios pueden ajustar cuánto cómputo invierte el modelo en el razonamiento antes de generar una respuesta. Esto permite un control detallado sobre el equilibrio entre la calidad de la respuesta y el costo o la latencia.
Inkling no es el modelo más potente disponible hoy en día; en cambio, una combinación de cualidades lo convierte en una buena base de pesos abiertos para la personalización.
Este posicionamiento honesto distingue a Inkling. En lugar de perseguir las puntuaciones más altas en los benchmarks, Thinking Machines se centró en construir un modelo base equilibrado y flexible que sobresale como punto de partida para el ajuste fino. El modelo está disponible en Tinker para personalización inmediata, y el equipo lo demostró haciendo que Inkling se ajustara a sí mismo: escribiendo su propio trabajo de entrenamiento, ejecutándolo y evaluando el resultado, todo dentro de la plataforma Tinker.
Estás buscando un modelo de pesos abiertos con licencia permisiva que equilibre la capacidad multimodal con una inferencia eficiente, y valoras la capacidad de ajustar y personalizar el modelo para tus propios casos de uso. Inkling es especialmente interesante si deseas experimentar con el esfuerzo de razonamiento controlable o necesitas un modelo que pueda manejar contextos largos a través de texto, imágenes y audio.
Otras herramientas que podrías considerar
Ejecuta modelos de código abierto de última generación (GLM 5.1, Kimi K2.7 Code, MiniMax M2.7 y más) en Claude Code a una velocidad hasta 4 veces mayor (hasta 200 tok/s) por un precio fijo de $29/mes. Configúralo en minutos, sin necesidad de modificar el código.
El mundo no puede construir capacidad de cómputo lo suficientemente rápido para satisfacer la demanda de IA. Por eso tomamos un camino diferente. ZeroGPU es una infraestructura de IA impulsada por modelos de lenguaje pequeños que se ejecutan en una red híbrida de borde que reutiliza el cómputo ya existente. No todas las tareas necesitan un modelo de frontera. Nuestros modelos optimizados para el borde y diseñados para propósitos específicos funcionan 10 veces más rápido, son un 50% más baratos y descargan entre el 70 y el 80% de las tareas de producción a modelos pequeños con precisión de nivel fronterizo.
En el momento en que un agente necesita desplegar algo, se topa de frente con un muro diseñado para humanos. Hoy lanzamos las Cuentas Temporales en Cloudflare Workers. Cualquier agente puede ejecutar ahora wrangler deploy —temporal— y obtener un Worker en vivo en cuestión de segundos.
GitHits permite a los agentes de codificación acceder al código de código abierto del que depende tu aplicación. Obtén ejemplos de implementación reales, navegación por el código fuente de las dependencias, inspección de paquetes y documentación. Los agentes pueden buscar y leer tu base de código. Pero no pueden buscar ni leer el código de código abierto del que depende tu aplicación. Ahí es donde empiezan a adivinar, reintentar y entrar en bucles. GitHits crea un índice consciente de la versión bajo demanda. Los agentes pueden buscar, navegar e inspeccionar el código detrás de sus dependencias. CLI: npx githits@latest init
Creador
neon_dev
Loading comments…