LuAITools.com
Submit
Código IA

Baseten

Baseten se centra en el despliegue de modelos de IA y la infraestructura de inferencia, para llevar modelos de machine learning a producción con rapidez.

Visitar sitio

🔍 ¿Qué es Baseten exactamente?

Baseten es una plataforma de infraestructura para inferencia y entrenamiento de modelos de IA, fundada en 2019 por Tuhin Srivastava, Amir Haghighat, Philip Howes y Pankaj Gupta. Los cuatro se conocían de haber trabajado juntos años atrás, y la idea de Baseten nació de una frustración compartida: habían construido modelos de machine learning y descubierto que el verdadero problema no era entrenarlos, sino ponerlos en producción y que funcionaran bien.

La compañía tiene su sede en San Francisco, aunque dos de sus fundadores son australianos y cerca del 80% de su equipo de investigación también lo es. En junio de 2026, Baseten cerró una ronda de financiación Serie F de 1.500 millones de dólares que la valoró en 13.000 millones de dólares, convirtiéndola en uno de los unicornios más valiosos de la infraestructura de IA.

El posicionamiento de Baseten es claro: no es una herramienta para crear aplicaciones de IA, es la capa que hace que esas aplicaciones funcionen. Cuando una empresa como Cursor necesita servir un modelo de lenguaje a millones de usuarios, necesita infraestructura que aguante. Baseten proporciona esa infraestructura, con motores de inferencia optimizados, gestión de capacidad multi-nube y despliegue en un solo comando.

Baseten
Baseten

⚙️ Funciones principales

  • Motores de inferencia optimizados: Baseten mantiene motores específicos para diferentes arquitecturas de modelo: Engine-Builder-LLM para modelos densos, BIS-LLM para modelos Mixture-of-Experts como DeepSeek o Qwen, y BEI para embeddings y clasificación.
  • Model APIs (OpenAI-compatible): puedes llamar a modelos alojados como DeepSeek V4, GLM 5.1 o GPT-OSS 120B mediante una API compatible con OpenAI, pagando por token en lugar de por GPU.
  • Despliegue dedicado de modelos: sube tu propio modelo (open source, fine-tuned o custom) y despliégalo en GPUs dedicadas con un comando, usando Truss como formato de empaquetado.
  • Entrenamiento y fine-tuning: Loops, su SDK de entrenamiento, permite ejecutar fine-tuning supervisado o reinforcement learning sobre GPUs H100/H200, con checkpoints que se despliegan automáticamente como endpoints.
  • Multi-cloud Capacity Management (MCM): provisiona GPUs a través de más de 20 proveedores cloud para garantizar disponibilidad y resiliencia. Si una región falla, la carga se redistribuye automáticamente.
  • Autoscaling y scale-to-zero: configuración por despliegue con objetivos de concurrencia, réplicas mínimas y máximas, y escalado a cero para no pagar por capacidad inactiva.
  • Observabilidad completa: logs en tiempo real, métricas y trazas de cada petición, exportables a Datadog, Prometheus, Grafana o New Relic.
  • Chains (pipelines multi-modelo): encadena varios modelos en un solo pipeline, útil para flujos como embedding + reranking + generación.

✨ Qué la hace diferente

La primera diferencia es el enfoque en inferencia, no en creación. Herramientas como v0, Lovable o Bolt.new te ayudan a construir aplicaciones. Baseten te ayuda a ejecutarlas cuando ya tienes millones de usuarios. Son capas distintas del stack. No compiten entre sí.

La segunda es la profundidad técnica de sus motores. Baseten no se limita a alquilar GPUs. Escribe y mantiene motores de inferencia optimizados para cada arquitectura de modelo. Cuando usas su API, no estás llamando a un modelo genérico; estás usando un motor específicamente compilado y optimizado para ese tipo de modelo.

La tercera es su modelo de negocio como intermediario de capacidad. Baseten no posee GPUs. Alquila capacidad de más de 20 proveedores cloud y la revende con su capa de software encima. Eso le da flexibilidad para ofrecer GPUs donde otros no pueden, pero también expone su margen a la volatilidad de los precios del cómputo.

Y la cuarta es su escala real. Clientes como Cursor, Notion, Mercor y OpenEvidence dependen de Baseten para servir modelos a cientos de millones de usuarios. La empresa reportó un crecimiento de ingresos recurrentes anuales de 2.000 millones a 6.000 millones de dólares en un solo trimestre de 2026. Eso no es una startup experimental; es infraestructura crítica.

🎯 Casos de uso reales

Equipos de ingeniería de IA que sirven modelos a escala. Este es el usuario principal. Si tu producto depende de un modelo de lenguaje y tienes tráfico real, necesitas inferencia que no falle. Baseten proporciona esa capa con SLA de disponibilidad alta y latencia optimizada.

Empresas que quieren migrar de modelos propietarios a open source. El argumento comercial de Baseten es claro: cambiar a modelos open source como DeepSeek o Qwen para tareas específicas puede costar apenas el 30% de lo que cuestan los modelos de OpenAI o Anthropic. Para empresas con volúmenes altos de inferencia, el ahorro es sustancial.

Model labs que quieren distribuir sus modelos. Baseten ofrece un programa específico para creadores de modelos que quieren servirlos y venderlos a través de su plataforma, gestionando la relación con el cliente y la facturación.

Equipos con requisitos de compliance. Baseten es SOC 2 Type II y HIPAA compliant, y ofrece despliegue self-hosted o híbrido para empresas que necesitan mantener los datos en su propia VPC.

Lo que no es: una herramienta para generar aplicaciones, escribir código o crear contenido. Baseten no compite con v0 ni con Lovable. Es la capa que está por debajo de esas herramientas, asegurándose de que los modelos que las alimentan funcionen.

🚀 Cómo empezar a usarlo

Registro. Entras a baseten.co, creas una cuenta, y accedes al dashboard. Las cuentas nuevas incluyen créditos promocionales para experimentar.

Opción A: usar Model APIs (la vía rápida). Si solo quieres llamar a un modelo alojado, generas una API key y apuntas el OpenAI SDK a la base URL de Baseten. Cambias dos líneas de código y empiezas a usar DeepSeek V4 o GLM 5.1 pagando por token.

Opción B: desplegar tu propio modelo (la vía completa). Instalas la CLI de Baseten, defines tu modelo con un archivo config.yaml (para arquitecturas soportadas) o una clase Python, y ejecutas el comando de despliegue. Baseten selecciona el motor adecuado, provisiona las GPUs y expone un endpoint HTTPS.

Configura autoscaling. Define el objetivo de concurrencia por réplica, los límites mínimo y máximo, y si quieres scale-to-zero. Para producción, se recomienda un mínimo de 2 réplicas para evitar cold starts.

Conecta observabilidad. Exporta métricas a tu herramienta preferida (Datadog, Prometheus, etc.) o usa los dashboards nativos de Baseten para monitorizar latencia, throughput y errores.

Promociona a producción. Baseten soporta entornos separados (dev, staging, prod) para que puedas validar cambios antes de exponerlos a usuarios reales.

💡 Trucos para sacarle más partido

  • Empieza con Model APIs antes de desplegar tu propio modelo. Si un modelo alojado cubre tu caso, no necesitas gestionar GPUs. Es más barato y más rápido de probar.
  • Usa el motor adecuado para tu arquitectura. Si tu modelo es Mixture-of-Experts, BIS-LLM está optimizado para eso. Si es un LLM denso, Engine-Builder-LLM. Elegir mal el motor desperdicia rendimiento.
  • Configura scale-to-zero para entornos de desarrollo. No pagues por GPUs inactivas en staging. Para producción, evalúa si el cold start es aceptable o si necesitas réplicas mínimas calientes.
  • Aprovecha el precio por token para cargas intermitentes. Si tu tráfico es bajo o irregular, Model APIs es casi siempre más barato que reservar GPUs dedicadas.
  • Considera Truss para portabilidad. El formato de empaquetado de Baseten es open source y portable. Si algún día quieres migrar a otra plataforma, tu definición de modelo sigue siendo útil.
  • Monitoriza los costes desde el primer día. Baseten expone una API de billing que devuelve costes diarios desglosados por API key, usuario, modelo y tier. Úsala para detectar gastos inesperados.

📱 Dónde puedes usarlo

Baseten es una plataforma cloud-first, accesible vía web y a través de su CLI para despliegue y gestión. No hay aplicación de escritorio nativa para Windows o Mac, ni app móvil para iOS o Android, ni extensión de navegador.

Existe un skill y servidores MCP que permiten a agentes de codificación (como Cursor, Claude Code o Windsurf) gestionar el workspace de Baseten y buscar en la documentación directamente desde el entorno de desarrollo. También soporta despliegue self-hosted en tu propia VPC y híbrido (core en tu VPC, burst a Baseten Cloud).

💰 Cuánto cuesta

Baseten tiene un modelo de precios dual: pago por token para Model APIs, y pago por GPU-hora para despliegue dedicado.

  • Basic (0 €/mes, pay-as-you-go): no hay mínimo mensual. Pagas por token consumido en Model APIs o por GPU-hora en despliegues dedicados. Las cuentas nuevas incluyen créditos promocionales.
  • Pro (precio a consultar): descuentos por volumen para equipos con uso alto y predecible. Se negocia caso por caso.
  • Enterprise (precio a consultar): despliegue self-hosted o híbrido, SLA personalizados, soporte dedicado y opciones de compliance específicas.

Precios de referencia para Model APIs (por 1M de tokens, entrada/salida): GPT-OSS 120B a $0.10/$0.50, DeepSeek V4 a $1.74/$3.48, GLM 5.1 a $1.30/$4.30. Precios de GPU dedicada: H100 a $6.50/hora, B200 a $9.98/hora, A100 80GB a $4.00/hora.

Un detalle importante: Baseten cobra por minuto en despliegues dedicados, y el tiempo de GPU inactiva se factura. Para cargas intermitentes, scale-to-zero está activado por defecto, pero las réplicas mínimas calientes generan coste.

👥 Para quién es (y para quién no)

Baseten encaja perfectamente con equipos de ingeniería de IA que sirven modelos a producción y necesitan disponibilidad, latencia y control de costes. También con empresas que quieren migrar de modelos propietarios a open source para reducir costes, y con model labs que quieren distribuir sus modelos sin construir infraestructura propia.

Es útil también para equipos con requisitos de compliance que necesitan SOC 2, HIPAA o despliegue self-hosted, y para startups de IA que están escalando y no quieren gestionar GPUs manualmente.

No es para ti si eres un desarrollador individual probando ideas, si no tienes tráfico real y solo necesitas prototipar, o si tu producto no depende de modelos de IA. Tampoco si tu presupuesto es extremadamente limitado y solo necesitas ejecutar un modelo pequeño ocasionalmente: Model APIs te cobrará por token, pero hay opciones más baratas para uso muy ligero.

🌍 Presencia global

Baseten tiene más de 100 clientes enterprise y una plantilla de aproximadamente 109 empleados. Sus clientes incluyen Cursor, Notion, Mercor, OpenEvidence, Abridge, Clay, Gamma, Sourcegraph y Writer, entre otros. La empresa reportó un crecimiento de ingresos recurrentes anuales de 2.000 millones a 6.000 millones de dólares en un solo trimestre de 2026, un aumento del 2.000% interanual.

Su infraestructura opera a través de más de 20 proveedores cloud, con presencia en múltiples regiones para garantizar disponibilidad y baja latencia. Los principales mercados son Estados Unidos, con presencia creciente en Europa y Australia, donde Blackbird realizó su mayor inversión individual en la ronda Serie F.

⚖️ Luces y sombras

Lo bueno:

  • Los motores de inferencia optimizados por arquitectura son un diferencial real. No estás alquilando GPUs desnudas; estás alquilando rendimiento optimizado.
  • El modelo de precios por token para Model APIs es ideal para cargas intermitentes o de bajo volumen, y el precio de GPT-OSS 120B ($0.10/$0.50) es competitivo con los proveedores más baratos del mercado.
  • La certificación SOC 2 Type II y HIPAA, junto con opciones self-hosted e híbridas, la hacen adecuada para empresas reguladas.
  • La escala de clientes (Cursor, Notion) demuestra que la plataforma aguanta tráfico real de producción, no solo demos.

Lo mejorable:

  • El precio de GPU dedicada es significativamente más alto que el de proveedores de cómputo más crudo. H100 a $6.50/hora frente a $1.79/hora de DeepInfra o ~$3.95/hora de Modal. Ese sobreprecio compra los motores optimizados, pero si tienes un experto en serving en tu equipo, puede que no te compense.
  • El modelo de negocio de revender capacidad de cloud tiene un riesgo estructural de márgenes. Si los precios mayoristas de GPU suben o fluctúan, Baseten tiene que absorber o trasladar ese coste.
  • La documentación es extensa pero técnica. No está pensada para principiantes. Si no tienes conocimientos de despliegue de modelos, la curva de aprendizaje es pronunciada.
  • No hay capa gratuita permanente más allá de créditos promocionales. Para experimentación continua sin coste, necesitas otras herramientas.

🆚 Baseten frente a sus competidores

El mercado de inferencia gestionada tiene varios actores, cada uno con su enfoque:

  • Replicate: es la opción más sencilla para publicar un modelo y compartirlo. Su catálogo de 50.000+ modelos es enorme. Pero no ofrece selección de motor optimizado ni la profundidad de control de Baseten. Es más para “publicar y olvidarse” que para “servir a escala con rendimiento crítico”.
  • Modal: es el competidor más directo en precio. Su H100 cuesta ~$3.95/hora frente a $6.50/hora de Baseten, y factura por segundo de ejecución activa. Su punto débil es que no tiene equivalentes a los Model APIs por token ni motores optimizados por arquitectura. Si tienes experiencia en serving, Modal es más barato. Si no, Baseten compensa con su capa de optimización.
  • DeepInfra: es el proveedor más barato de GPU dedicada del mercado (H100 a $1.79/hora). No ofrece la capa de motores optimizados de Baseten, pero para equipos que saben lo que hacen y solo necesitan cómputo crudo, es difícil de superar en coste.
  • Fireworks AI: compite en el espacio de inferencia serverless con precios por token similares. Tiene SOC 2 y HIPAA. Su enfoque está más en modelos open source populares y menos en despliegue de modelos custom.

La posición de Baseten es la de una plataforma que prioriza rendimiento y fiabilidad sobre coste bruto. No es la opción más barata si solo comparas GPU-hora. Es la opción que te ahorra contratar a un ingeniero de serving si no lo tienes, y que te da motores optimizados que en bakeoffs superan a competidores por un 40-50% en rendimiento.

✅ Veredicto final: ¿merece la pena?

Sí, si tienes un producto de IA en producción y necesitas que funcione sin caerse.

Baseten no es para todos. No es una herramienta para prototipar, ni para aprender, ni para uso personal. Es infraestructura para equipos que ya han pasado esa fase y ahora tienen que servir modelos a usuarios reales. Si estás en ese punto, Baseten resuelve un problema que de otra forma requiere contratar especialistas o construir una capa de serving desde cero.

Es especialmente recomendable si tu equipo no tiene un experto en optimización de inferencia y valoras los motores optimizados por arquitectura. Si quieres migrar cargas de modelos propietarios a open source para reducir costes. Si necesitas SOC 2 o HIPAA para tus workloads. Y si tu tráfico es lo suficientemente alto como para que el sobreprecio de GPU se justifique por el ahorro en ingeniería.

No la recomendaría si solo estás prototipando y no tienes tráfico real. Si tienes un equipo con experiencia profunda en serving y solo necesitas GPUs baratas, DeepInfra o Modal te saldrán mejor de precio. Y si tu producto no depende de modelos de IA, no tiene ningún sentido.

La forma sensata de evaluarla es empezar con Model APIs para una carga pequeña y medir latencia, coste y fiabilidad. Si funciona bien y el coste por token encaja en tu economía, el siguiente paso es evaluar despliegue dedicado. Si no tienes claro que tu producto vaya a necesitar inferencia a escala, no es tu momento todavía.

Comentarios