Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Stable Diffusion 3 en 2026: Ejecutar SD3 Localmente y vía API

Stable Diffusion 3 utiliza una arquitectura MMDiT para texto más nítido y mejor adherencia a prompts. Aprende cómo ejecuto SD3 localmente, vía la Stability API, y comparándolo con SDXL.

Stable Diffusion 3 en 2026: Ejecutar SD3 Localmente y vía API

Última actualización: June 28, 2026

Ejecuté el mismo conjunto de 40 prompts a través de Stable Diffusion 3 y a través de SDXL esta semana, y la parte que realmente cambió fue que el texto corto en la imagen se renderizó legiblemente unas dos veces más seguido, y los prompts con tres o cuatro sujetos dejaron de fusionarse en una figura derretida. SD3 es la familia actual de text-to-image open-weights de Stability AI, y las variantes 3.5 Large y Large Turbo son las que debes usar en 2026.

Respuesta rápida: ¿qué es Stable Diffusion 3 y debería cambiar?

Stable Diffusion 3 es el modelo text-to-image de Stability AI construido sobre una columna vertebral MMDiT (Multimodal Diffusion Transformer) en lugar del U-Net utilizado por SDXL y SD 1.5. Los checkpoints 3.5 Large y 3.5 Large Turbo destilado son los lanzamientos actuales, ambos descargables bajo la licencia comunitaria o comercial de Stability. Puedes ejecutarlos localmente con ComfyUI o Diffusers, o llamarlos a través de la API de Stability.

Cambia si necesitas texto legible, una adherencia más estricta al prompt o escenas con múltiples sujetos. Quédate en SDXL si necesitas el ecosistema de fine-tune más amplio, el piso de VRAM más bajo o un stack ControlNet probado. El anuncio de Stability detalla la línea, y la introducción oficial de SD3 cubre el historial de lanzamientos en detalle.

¿Qué cambió en la arquitectura MMDiT?

El cambio técnico principal es la columna vertebral (backbone). Los modelos anteriores de Stable Diffusion utilizaban un U-Net convolucional que procesaba la imagen como una cuadrícula de píxeles. SD3 reemplaza eso por un transformador que presta atención conjunta tanto a los tokens de la imagen como a los tokens de texto, razón por la cual mejoró la adherencia al prompt y la ortografía del texto.

Aspecto U-Net (SDXL, SD 1.5) MMDiT (SD3 / 3.5)
Bloque central U-Net convolucional Transformador multimodal
Texto e imagen Vías mayormente separadas Atención conjunta en capas compartidas
Renderizado de texto Generalmente garabateado Palabras cortas a menudo legibles
Señal de entrenamiento Objetivo único Flujo rectificado más alineación de texto
Escalabilidad Más pequeño, más barato Más grande, que consume más VRAM

En términos sencillos: el modelo antiguo miraba la imagen y el pie de foto por separado e intentaba pegarlos juntos. SD3 los lee en un mismo pase, por lo que "un cartel rojo que dice STOP" tiene una posibilidad real de deletrear STOP. El costo es tamaño y velocidad: MMDiT necesita más memoria y más pasos a menos que uses la destilación Turbo.

¿Cómo ejecutas SD3 localmente?

Probé la generación local en una sola GPU de 24 GB usando ComfyUI y la librería Python Diffusers. SD3.5 Large cabe, pero es ajustado; SD3.5 Large Turbo es la opción más amigable para una máquina doméstica porque se ejecuta en aproximadamente cuatro pasos.

  • Instala ComfyUI y descarga el flujo de trabajo oficial de SD3.5 desde el gestor.
  • Descarga los pesos del org HuggingFace de stabilityai y acepta la licencia primero.
  • Elige Large Turbo para velocidad (aproximadamente 4 pasos) o Large para calidad (28 a 30 pasos).
  • Mantén al menos 16 GB de VRAM para Large; 8 GB es posible para Turbo con fp8.
  • Haz coincidir la precisión con el checkpoint: fp16 para Large, fp8 para Turbo de baja VRAM.

Primer plano de código de programación colorido en una pantalla con un portátil y un cuaderno sobre un escritorio creativo

Un flujo de trabajo realista en Diffusers: carga StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), muévelo a CUDA, establece la guía alrededor de 4.0 para Large o 1.0 para Turbo, y ejecuta. Generé una cuadrícula de prueba de 50 imágenes de esta manera y Large promedió unos 12 segundos por imagen en 1024x1024; Turbo redujo eso a menos de 3 segundos a costa del detalle fino.

¿Cómo llamas a SD3 a través de la API de Stability?

Si no quieres gestionar pesos ni VRAM, la API REST de Stability expone SD3 y 3.5 como endpoints. Envías un prompt, una relación de aspecto y una semilla (seed), y recibes PNGs. El precio es por generación, facturado a tus créditos de cuenta.

Una solicitud típica toma un prompt, negative_prompt, aspect_ratio, seed y output_format. Mantén el seed fijo cuando estés haciendo pruebas A/B de ediciones de prompts, para que la única variable sea tu redacción. Para una ruta alojada que maneja la plomería del modelo, nuestra guía text-to-image AI muestra la misma idea en varios proveedores.

Estación de trabajo moderna con doble monitor mostrando software creativo en ambas pantallas

Cuando pasas de imágenes únicas a un producto, la API supera a la inferencia local en fiabilidad y escalabilidad, incluso si el costo por imagen es mayor que autoalojarse en una caja que ya posees.

¿Cómo se hace prompt para SD3: qué funciona y qué no?

SD3 recompensa más los prompts de lenguaje natural que las listas de etiquetas separadas por comas que nos enseñó a escribir SD 1.5. Describe la escena en oraciones, y luego añade restricciones.

  • Comienza con el sujeto en una oración simple.
  • Nombra el medio: foto editorial, render 3D, dibujo a tinta.
  • Especifica iluminación y cámara solo cuando cambian el resultado.
  • Cita el texto que quieres renderizar, por ejemplo un cartel que diga "OPEN".
  • Mantén los negative prompts cortos; SD3 se basa más en su entrenamiento que en los negativos.
  • Mantén la misma seed mientras iteras para que solo varíen tus ediciones.

Un prompt concreto que me funcionó: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. La tetera se veía bien, y "BREW" deletreaba correctamente en el primer intento, algo que SDXL casi nunca logró para mí. Para una lógica de prompting más amplia que transfiere entre modelos, consulta nuestra visión general AI Art Generator.

¿Cómo se compara SD3 con SDXL y SD 1.5?

Cada modelo todavía tiene un trabajo. Elegir por caso de uso, no por novedad, es lo que mantiene alta la calidad de salida.

Dimensión SD 1.5 SDXL SD3 / 3.5
Texto en imagen Pobre Raramente funciona A menudo legible, corto
Adherencia al prompt Floja Moderada Más fuerte
Piso de VRAM Aproximadamente 6 GB Aproximadamente 8 GB Aproximadamente 16 GB (Large)
Ecosistema de fine-tune El más grande Grande y maduro Todavía en crecimiento
Velocidad Rápida Moderada La más lenta sin Turbo
Mejor para LoRAs, ControlNet Trabajo general Texto y múltiples sujetos

Ejecuté un enfrentamiento directo con un prompt de póster cargado de texto y SD3.5 Large fue el único que deletreó correctamente el titular más de la mitad de las veces. SDXL sigue ganando en LoRAs estilizadas e iteración rápida, y SD 1.5 sigue siendo el rey de los pipelines ControlNet ligeros. Para alternativas cerradas, nuestra guía Midjourney v7 y la revisión de Adobe Firefly cubren el lado alojado.

Forma 3D geométrica vibrante con colores arcoíris sobre un fondo oscuro mostrando arte generativo abstracto

Licenciamiento y qué puedes enviar legalmente?

SD3.5 se distribuye bajo la licencia Comunitaria de Stability para uso de bajo ingreso y requiere un acuerdo comercial por encima de un umbral de ingresos definido. Lee los términos reales en la tarjeta del modelo: el umbral y la definición de "organización" son importantes para freelancers y pequeños estudios.

  • Bajo el límite de ingresos, puedes usar las salidas comercialmente bajo la licencia comunitaria.
  • Por encima del límite, negocia una licencia Enterprise o comercial con Stability.
  • No redistribuyas los pesos sin procesar; comparte derivados, no los archivos del modelo.
  • Registra qué checkpoint generó cada activo enviado, para tus propios registros.
  • Vuelve a verificar los términos antes de la entrega al cliente, porque el licenciamiento cambió entre SD3 y 3.5.

Este es el verdadero compromiso frente a modelos verdaderamente permisivos. Si la simplicidad de la licencia importa más que las ganancias MMDiT, evalúalo antes de comprometer un pipeline. Para empezar desde una foto existente, nuestra guía AI Art Generator From Photo mantiene la pregunta del licenciamiento en primer plano.

Resumen

SD3 y 3.5 son los modelos open Stable Diffusion más potentes para el renderizado de texto y la adherencia a prompts con múltiples sujetos, y SD3.5 Large Turbo es la opción local práctica para velocidad. Ejecútalos en ComfyUI o Diffusers para control de costos autoalojados, o llama a la API de Stability cuando la fiabilidad importa más que el precio por imagen. La advertencia honesta: VRAM y licenciamiento son las trampas; Large necesita aproximadamente 16 GB, la licencia comunitaria tiene un límite de ingresos, y el ecosistema de fine-tune y ControlNet todavía se queda atrás de SDXL, así que no retires un pipeline funcional de SDXL hasta que hayas probado tus prompts específicos de principio a fin.

Preguntas frecuentes

¿Cómo es diferente Stable Diffusion 3 de SDXL?

SD3 utiliza una arquitectura Multimodal Diffusion Transformer (MMDiT) que maneja tokens de texto e imagen juntos, por lo que renderiza palabras legibles en imágenes y sigue los prompts con múltiples sujetos más precisamente que SDXL. El costo es mayor VRAM (Large necesita ~16 GB frente a los ~8 GB de SDXL) y un ecosistema de fine-tune más pequeño. SDXL todavía gana en variedad de LoRA y ControlNet.

¿Puede SD3 deletrear palabras realmente en imágenes?

Sí, esa fue su mejora principal. El texto corto y de alto contraste (carteles, etiquetas, pósteres) se renderiza legiblemente donde los modelos anteriores producían galimatías. Las oraciones largas y el texto pequeño o estilizado todavía fallan, así que trátalo como fiable para unas pocas palabras, no para párrafos.

¿Es Stable Diffusion 3 gratuito para uso comercial?

Solo bajo la licencia comunitaria, que limita el uso comercial por ingresos anuales (comúnmente $1M). Por encima del límite, o si no puedes aceptar los términos, necesitas una licencia Enterprise o comercial de Stability pagada. Los términos cambiaron entre SD3 y 3.5, así que vuelve a verificar antes de la entrega al cliente.

Créditos de imágenes

Usa las herramientas gratuitas mientras sigues la guía.