Baseten ahora aparece como Inference Provider en el Hub de Hugging Face: eso significa que puedes ejecutar inferencia serverless desde las páginas de modelos, elegir Baseten como proveedor preferido y usar los modelos alojados por Baseten con muy poco setup. ¿Te imaginas probar un LLM nuevo en minutos desde la misma interfaz del Hub? Eso es justo lo que habilita esta integración.
Qué ofrece la integración
Baseten se suma al ecosistema de Inference Providers de Hugging Face, aportando soporte para tareas conversacionales y generación de texto desde modelos de vanguardia. Entre los modelos citados están Kimi K3, DeepSeek V4 Flash, GLM-5.2 y otros pesos abiertos que Baseten tiene en su catálogo.
La integración llega además al cliente: está soportada en los SDKs de Hugging Face para Python y JavaScript, por lo que puedes invocar esos modelos desde tus apps con la misma experiencia que usarías otros proveedores.
- Soporte para varios tipos de modelos: LLMs, text-to-speech y más.
- Acceso serverless directo desde las páginas de modelos en el Hub.
- Integración en los SDKs oficiales (Python y JS) y en harnesses de agentes.
Modos de uso y autenticación
Hay dos formas de llamar a un Inference Provider desde Hugging Face: usando una clave propia del proveedor, o dejando que Hugging Face enrute la petición.
- Modo con clave propia (custom key): la petición va directamente al proveedor (por ejemplo Baseten) usando tu API key de Baseten. La facturación se realiza en la cuenta del proveedor.
- Modo enrutado por Hugging Face (routed by HF): no necesitas la API key del proveedor; autenticas con tu token de Hugging Face y los cargos se aplican a tu cuenta de HF. Hugging Face no añade un markup; simplemente pasa los costos del proveedor.
Además, en tu cuenta puedes:
- Configurar las API keys de los proveedores con los que te registraste.
- Ordenar los proveedores por preferencia; esa orden aplica en el widget y en los snippets de código de las páginas de modelo.
Importante: si no configuras una clave personalizada, tus peticiones serán enroutadas por Hugging Face por defecto.
SDKs y ejemplos prácticos
Para usar Baseten a través de Hugging Face necesitas versiones recientes de los SDKs: huggingface_hub (>= 1.26.1) en Python y @huggingface/inference para JavaScript. Aquí tienes los ejemplos que muestran cómo invocar DeepSeek V4 Flash a través del enrutador de Hugging Face.
Python (ejemplo usando el cliente OpenAI compatible con el router de HF):
import os
from openai import OpenAI
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
messages=[
{"role": "user", "content": "Write a Python function that returns the nth Fibonacci number using memoization."}
],
)
print(completion.choices[0].message)
JavaScript (Node.js):
import { OpenAI } from "openai";
const client = new OpenAI({
baseURL: "https://router.huggingface.co/v1",
apiKey: process.env.HF_TOKEN,
});
const chatCompletion = await client.chat.completions.create({
model: "deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
messages: [
{ role: "user", content: "Write a Python function that returns the nth Fibonacci number using memoization." },
],
});
console.log(chatCompletion.choices[0].message);
Si en vez de enrutar por HF usas directamente la API key de Baseten, la factura se realiza en tu cuenta de Baseten. Si usas la ruta de HF, pagarás las tarifas estándar del proveedor desde tu cuenta de HF.
Integraciones con agentes y herramientas
Hugging Face menciona que los Inference Providers están integrados en la mayoría de Agent Harnesses como Pi, OpenCode, Hermes Agents, OpenClaw y otros. ¿Qué significa en la práctica? Significa que puedes conectar modelos alojados en Baseten directamente a esos agentes sin necesidad de escribir glue code adicional. Es un ahorro de tiempo si ya usas alguno de esos frameworks.
Consideraciones de costos y plan PRO
- Peticiones enrutadas por HF se cobran en tu cuenta de Hugging Face, sin markup adicional.
- Peticiones con claves directas se cobran en la cuenta del proveedor correspondiente.
- Los usuarios PRO de Hugging Face reciben 2 USD en créditos de Inference cada mes que pueden usar en cualquier proveedor.
- Hay una cuota gratuita pequeña para usuarios con cuenta gratuita, pero si necesitas más uso conviene evaluar el plan PRO.
¿Por qué te debería interesar?
Porque reduce la fricción para probar y desplegar modelos: menos configuraciones, acceso a modelos frontier y la flexibilidad de elegir cómo autenticar y facturar tus llamadas. Si construyes prototipos o productos que consumen modelos de terceros, esta integración te da rutas más rápidas para experimentar y escalar.
Piénsalo así: en lugar de desplegar infra, ajustar contenedores y administrar endpoints, puedes probar un modelo desde la página del Hub y pasarlo a tu app con un par de clicks o una llamada desde el SDK. ¿No es eso justo lo que buscan la mayoría de desarrolladores y equipos pequeños?
