Mercado de modelos
cohere/north-mini-code:freeNorth Mini Code es el primer modelo de codificación con agentes de Cohere y el debut de su familia North. Este modelo, una mezcla dispersa de expertos con 30 mil millones de parámetros totales y 3 mil millones de parámetros activos, está optimizado para la generación de código, la ingeniería de software con agentes y las tareas de terminal. Además, está entrenado para generalizar en entornos de agentes como OpenCode y SWE-Agent. Ofrece una ventana de contexto de 256 000 tokens con hasta 64 000 tokens de salida, admite el razonamiento intercalado y el uso de herramientas mediante esquemas JSON, y se distribuye con código abierto bajo la licencia Apache 2.0. Su reducido número de parámetros activos permite una inferencia de baja latencia, incluso en hardware local.
diffusiongemma-26b-a4b-itDiffusionGemma 26B A4B IT es un modelo generativo multimodal de pesos abiertos desarrollado por Google DeepMind que procesa entradas de texto, imágenes y vídeo para generar texto mediante difusión discreta. Basado en la arquitectura «Mixture-of-Experts» (MoE) de Gemma 4 26B A4B, con un total de 25,2 mil millones de parámetros y 3,8 mil millones de parámetros activos, el modelo emplea un diseño de codificador-decodificador con atención bidireccional que genera tokens en bloques paralelos de 256 tokens, lo que permite una generación a alta velocidad que supera los 1.100 tokens por segundo con lotes de tamaño reducido en NVIDIA Hopper H100 (FP8). DiffusionGemma 26B A4B IT admite una ventana de contexto de 256 000 tokens, un modo de razonamiento configurable, llamadas a funciones nativas e inferencia multilingüe en más de 35 idiomas.
gpt-oss-120bEl modelo gpt-oss-120b está diseñado arquitectónicamente como un modelo de «mezcla de expertos» (MoE). Este modelo incorpora activaciones SwiGLU y «attention sinks» aprendidos dentro de su arquitectura. Funciona como un modelo de razonamiento y admite capacidades como el procesamiento de cadenas de pensamiento, niveles ajustables de esfuerzo de razonamiento, el seguimiento de instrucciones y el uso de herramientas. Este modelo es exclusivamente de texto, tanto en la modalidad de entrada como en la de salida, lo que permite a las empresas y a las administraciones públicas implementarlo en sus propias instalaciones o en entornos de nube privada para mejorar la seguridad y la privacidad de los datos.
gpt-oss-20bEl modelo gpt-oss-20b está diseñado como un modelo de «mezcla de expertos» (MoE), estructuralmente idéntico a la variante más grande de 117B, aunque con hiperparámetros diferentes. Este modelo utiliza activaciones SwiGLU e incorpora «sumideros de atención» aprendidos dentro de su arquitectura. Desde el punto de vista funcional, actúa como un modelo de razonamiento robusto, que admite capacidades avanzadas como el procesamiento de cadenas de pensamiento, niveles ajustables de esfuerzo de razonamiento, el seguimiento de instrucciones y el uso de herramientas. Funciona exclusivamente con modalidades de solo texto, tanto en la entrada como en la salida. Una ventaja estratégica clave es su idoneidad para empresas y administraciones públicas, ya que facilita la implementación en instalaciones propias o en la nube privada para garantizar una mayor seguridad y privacidad de los datos.
gemma-4-31b-itGemma 4 31B IT es un modelo multimodal abierto desarrollado por Google DeepMind que admite entradas de texto e imágenes, puede procesar vídeo como secuencias de fotogramas y genera salida de texto. Está diseñado para ofrecer un rendimiento de vanguardia en razonamiento, flujos de trabajo agenticos, programación y comprensión multimodal en GPU y estaciones de trabajo de consumo, con una ventana de contexto de 256K tokens y compatibilidad con más de 140 idiomas. El modelo utiliza un mecanismo de atención híbrido que intercala la atención local de ventana deslizante con la atención global completa, con claves y valores unificados en las capas globales y RoPE proporcional (p-RoPE) para mejorar el rendimiento en contextos largos.
llama-nemotron-embed-vl-1b-v2El modelo de incrustación Llama Nemotron Embed VL 1B V2 está optimizado para la recuperación multimodal de preguntas y respuestas. El modelo puede incrustar «documentos» en forma de imagen, texto o una combinación de imagen y texto. Los documentos se pueden recuperar a partir de una consulta del usuario en formato de texto. El modelo admite imágenes que contengan texto, tablas, gráficos e infografías.
gpt-4oSegún las mediciones realizadas con los parámetros de referencia tradicionales, gpt-4o alcanza un rendimiento similar al de gpt-4 turbo en inteligencia de texto, razonamiento y codificación, al tiempo que establece nuevos récords en capacidades multilingües, de audio y de visión.
groq/llama-3.3-70b-versatileSin descripción
llama-3.3-70b-instructEl modelo de lenguaje a gran escala (LLM) multilingüe Meta Llama 3.3 es un modelo generativo preentrenado y ajustado para instrucciones con 70 mil millones de parámetros (entrada y salida de texto). El modelo Llama 3.3, ajustado para instrucciones y dedicado exclusivamente al texto, está optimizado para casos de uso de diálogo multilingüe y supera a muchos de los modelos de chat, tanto de código abierto como de código cerrado, disponibles en el mercado en las pruebas de rendimiento habituales del sector.
nv-embed-v1El modelo NV-Embed es un modelo de incrustación generalista que destaca en 56 tareas, entre las que se incluyen la recuperación, la reordenación, la clasificación, la agrupación en clústeres y la similitud textual semántica. NV-Embed alcanza la puntuación más alta, 59,36, en 15 tareas de recuperación dentro de esta prueba comparativa. NV-Embed presenta varios diseños innovadores, como vectores latentes para mejorar la salida de las incrustaciones agrupadas y un método de ajuste de instrucciones en dos etapas, lo que mejora la precisión tanto de las tareas de recuperación como de las que no lo son. Para obtener más detalles técnicos, consulta el artículo: «NV-Embed: técnicas mejoradas para entrenar modelos de lenguaje a gran escala (LLM) como modelos de incrustación generalistas».
seed-2-0-codeDola-Seed-2.0-Code está optimizado para escenarios de codificación de nivel empresarial. Basándose en las sólidas capacidades de gestión de agentes y VLM de Seed 2.0, refuerza aún más la generación de código y el rendimiento de la ingeniería de software. Ofrece resultados de front-end particularmente sólidos y está especialmente optimizado para las necesidades de codificación multilingüe que se encuentran comúnmente en entornos empresariales, lo que lo hace idóneo para la integración con una amplia gama de herramientas de codificación de IA.
minimax-m2.7MiniMax M2.7 es un modelo de lenguaje extenso para la ingeniería de software compleja, el uso de herramientas basadas en agentes y los flujos de trabajo de productividad de oficina. Se presenta como un modelo que participa activamente en su propia evolución, con soporte para sistemas de agentes complejos, búsqueda dinámica de herramientas, equipos de agentes y tareas de codificación y edición de documentos de alta fidelidad.
minimax-m3MiniMax-M3 es un modelo multimodal de visión y lenguaje (VLM) basado en una arquitectura de «mezcla de expertos» (Mixture-of-Experts) para el razonamiento con contextos largos, flujos de trabajo agentivos y tareas creativas. El modelo procesa entradas de texto, imágenes y vídeo, y genera salidas de texto, centrándose especialmente en la comprensión de vídeos de larga duración, la programación a largo plazo y los flujos de trabajo de diseño y creativos. Traducción realizada con la versión gratuita del traductor DeepL.com
mistral-medium-3.5-128bMistral Medium 3.5 es el primer modelo integrado insignia de Mistral AI. Se trata de un modelo denso de 128 bytes con una ventana de contexto de 256k, que gestiona el seguimiento de instrucciones, el razonamiento y la codificación con un único conjunto de pesos. Mistral Medium 3.5 reemplaza a su predecesor, Mistral Medium 3.1, y a Magistral en Le Chat. También reemplaza a Devstral 2 en nuestro agente de codificación Vibe. En concreto, se espera un mejor rendimiento en las tareas de instrucciones, razonamiento y codificación con este nuevo modelo unificado, en comparación con nuestros modelos anteriores. El esfuerzo de razonamiento es configurable por solicitud, por lo que el mismo modelo puede responder rápidamente a un chat o realizar una ejecución compleja de un agente. El codificador de visión se entrenó desde cero para gestionar tamaños y relaciones de aspecto de imagen variables.
mistral-small-4-119b-2603Mistral Small 4 es un potente modelo híbrido capaz de actuar tanto como modelo de instrucción general como de razonamiento. Unifica las capacidades de tres familias de modelos diferentes —Instruct, Reasoning (anteriormente denominado Magistral) y Devstral— en un único modelo unificado. Gracias a sus capacidades multimodales, su arquitectura eficiente y su cambio de modo flexible, es un potente modelo de uso general para cualquier tarea. En una configuración optimizada para la latencia, Mistral Small 4 logra una reducción del 40 % en el tiempo de ejecución de extremo a extremo, y en una configuración optimizada para el rendimiento, gestiona tres veces más solicitudes por segundo en comparación con Mistral Small 3.
nemotron-3-super-120b-a12bNemotron-3-Super-120B-A12B-BF16 es un modelo de lenguaje a gran escala (LLM) entrenado por NVIDIA, diseñado para ofrecer sólidas capacidades de agencia, razonamiento y conversación. Está optimizado para agentes colaborativos y cargas de trabajo de gran volumen, como la automatización de tickets de TI. Al igual que otros modelos de la familia, responde a las consultas y tareas de los usuarios generando primero una traza de razonamiento y concluyendo luego con una respuesta final. Las capacidades de razonamiento del modelo se pueden configurar mediante un indicador en la plantilla de chat. El modelo emplea una arquitectura híbrida Latent Mixture-of-Experts (LatentMoE), que utiliza capas intercaladas de Mamba-2 y MoE, junto con capas de atención seleccionadas. A diferencia del modelo Nano, el modelo Super incorpora capas de predicción multitoken (MTP) para una generación de texto más rápida y una calidad mejorada, y se entrena utilizando cuantificación NVFP4 para maximizar la eficiencia computacional. El modelo cuenta con 12 000 millones de parámetros activos y 120 000 millones de parámetros en total. Los idiomas admitidos son: inglés, francés, alemán, italiano, japonés, español y chino.
nemotron-3-ultra-550b-a55bNemotron-3-Ultra-550B-A55B-NVFP4 es un modelo de lenguaje a gran escala (LLM) de vanguardia entrenado por NVIDIA, diseñado para ofrecer sólidas capacidades de agencia, razonamiento y conversación. Está optimizado para las cargas de trabajo más exigentes, incluyendo agentes complejos de múltiples pasos, análisis de contextos largos y razonamiento de alta precisión sobre código, matemáticas y ciencias. Al igual que otros modelos de la familia, responde a las consultas y tareas de los usuarios generando primero un rastro de razonamiento y concluyendo después con una respuesta final. Las capacidades de razonamiento del modelo se pueden configurar mediante un indicador en la plantilla de chat. El modelo emplea una arquitectura híbrida Latent Mixture-of-Experts (LatentMoE), que utiliza capas intercaladas de Mamba-2 y MoE, junto con capas de atención seleccionadas. Al igual que el modelo Super, el modelo Ultra incorpora capas de predicción multitoken (MTP) para una generación de texto más rápida y una calidad mejorada, y se entrena utilizando una receta de preentrenamiento NVFP4 para maximizar la eficiencia computacional. El modelo cuenta con 55 000 millones de parámetros activos y 550 000 millones de parámetros en total. Los idiomas admitidos son: inglés, francés, español, italiano, alemán, japonés, coreano, hindi, coreano, portugués de Brasil y chino.
nemotron-3.5-content-safetyEl modelo de seguridad de contenidos Nemotron 3.5 es un modelo de lenguaje pequeño (SLM) que utiliza el modelo Gemma-3-4B-it de Google como base y ha sido ajustado por NVIDIA con conjuntos de datos multimodales y multilingües relacionados con la seguridad de contenidos. Puede actuar como moderador de seguridad de contenidos tanto para las entradas como para las respuestas de los modelos de lenguaje grandes (LLM) y los modelos de lenguaje grandes verticales (VLM). Puede considerarse una extensión del popular modelo de seguridad de contenidos Nemotron 8B, que evalúa la seguridad de las peticiones y respuestas únicamente para los LLM. El modelo toma como entrada una petición, una imagen opcional y una respuesta opcional, y devuelve una cadena que contiene etiquetas de seguridad para la entrada (petición e imagen) y para la respuesta (si la hay). Si la entrada o la respuesta no son seguras, también puede devolver, de forma opcional, una lista de las categorías de seguridad que se han infringido. El modelo utiliza la misma taxonomía de seguridad que el modelo de seguridad de contenidos Nemotron 8B. El modelo se entrenó como un adaptador LoRA y los pesos se fusionaron de nuevo con el modelo principal Gemma-3-4b-it. Para obtener más información sobre el modelo, consulta este enlace de Huggingface. Ten en cuenta que hay varios modelos «guard» disponibles para la comunidad, algunos de código abierto y otros de código cerrado. Sin embargo, no todos los modelos «guard» pueden realizar las mismas funciones. La imagen siguiente muestra las diferencias en cuanto a la entrada de estos modelos.
qwen3.5-122b-a10bQwen3.5-122B-A10B es un modelo multimodal de visión y lenguaje basado en la «mezcla de expertos» (Mixture-of-Experts), diseñado para aplicaciones de agentes multimodales nativos, que admite entradas de texto, imágenes y vídeo. Integra el aprendizaje multimodal, la eficiencia arquitectónica y el aprendizaje por refuerzo a gran escala para mejorar el rendimiento en áreas como el razonamiento, la programación, los agentes y la comprensión visual.
qwen3.5-397b-a17bQwen3.5-397B-A17B es un modelo base multimodal que cuenta con una arquitectura híbrida de «mezcla de expertos» (Mixture-of-Experts) con entrenamiento de fusión temprana de visión y lenguaje, diseñado para ofrecer un rendimiento de vanguardia en chat, generación aumentada por recuperación, comprensión de visión y lenguaje, comprensión de vídeo y flujos de trabajo con agentes. Entre sus características más destacadas se incluyen: Base unificada de visión y lenguaje: el entrenamiento de fusión temprana en tokens multimodales alcanza la paridad intergeneracional con modelos anteriores basados únicamente en texto y supera a los modelos dedicados de visión y lenguaje en pruebas de rendimiento de razonamiento, programación, agentes y comprensión visual. Arquitectura híbrida eficiente: las redes Gated Delta, combinadas con una «mezcla de expertos» dispersa, proporcionan una inferencia de alto rendimiento con una latencia y unos costes adicionales mínimos. Generalización escalable del aprendizaje por refuerzo: el aprendizaje por refuerzo se escala en entornos de millones de agentes con distribuciones de tareas progresivamente complejas para lograr una adaptabilidad robusta al mundo real. Cobertura lingüística global: compatibilidad ampliada a 201 idiomas y dialectos, lo que permite un despliegue inclusivo a nivel mundial con una comprensión matizada de los matices culturales y regionales. Modo de reflexión: funciona en modo de reflexión de forma predeterminada, generando contenido de razonamiento interno (<think>...</think>) antes de producir las respuestas finales, con la opción de desactivarlo para obtener respuestas directas.
step-3.7-flashStep-3.7-Flash es un modelo de visión y lenguaje de StepFun basado en Step 3.5 Flash, con capacidades de visión adicionales para casos de uso nativos multimodales, agenticos y relacionados con la programación. El modelo está diseñado para procesar entradas de texto e imágenes y generar salidas de texto, haciendo hincapié en la comprensión de imágenes, el rendimiento rápido y los flujos de trabajo relacionados con el uso de herramientas.
Modo de recarga fuera de línea. Contacta al administrador para abrir una cuenta o recargar.