Midjourney (generador de imágenes)
Midjourney es un generador de imágenes con inteligencia artificial, accesible desde Discord y desde la web. Lanzado en beta abierta el 12 de julio de 2022, genera imágenes detalladas a partir de descripciones en texto. En agosto de 2024 se incorporó una interfaz web propia, junto con el lanzamiento de la versión 6.1.
Puntos importantes
- Los prompts precisos y afirmativos funcionan mejor. Conviene describir lo que se quiere ver, no lo que se quiere evitar, y refinar a través de iteraciones: el resultado ideal casi nunca sale del primer intento.
- Cuatro elementos estructuran la mayoría de los resultados de calidad: sujeto, iluminación, ángulo de cámara y relación de aspecto. Dominar estos pilares es más útil que dominar funciones avanzadas.
- Parámetros como --style raw, --s (stylize), --c (chaos), --w (weirdness) y las referencias de estilo (--sref, --sw) marcan la diferencia entre imágenes genéricas y resultados consistentes con una identidad visual.
- Esta guía incluye estructuras de prompt listas para usar en fotografía de producto, materiales de marketing, imágenes para blog, contenido para redes sociales e ilustración narrativa.
Qué es Midjourney y cómo funciona
Midjourney es un sistema de IA que genera imágenes a partir de texto. Durante años se accedió exclusivamente a través de Discord; en agosto de 2024 se sumó una interfaz web con el lanzamiento de la versión 6.1. La plataforma ha evolucionado en varias iteraciones: la versión 6 fue entrenada desde cero para mejorar la interpretación de texto, el control de detalles y la coherencia en escenas complejas.
El flujo básico es sencillo: se escribe un prompt con el comando /imagine en Discord o directamente en la app web, se recibe una cuadrícula de cuatro opciones y se selecciona la que más convence para ampliarla o generar variaciones. La generación toma entre 30 y 60 segundos por tanda.
Midjourney no busca imágenes existentes en la web. Crea imágenes completamente nuevas basadas en patrones aprendidos durante el entrenamiento — lo que abre posibilidades creativas, pero también plantea preguntas sobre los datos de entrenamiento y los posibles sesgos del modelo.
Nota: Midjourney procesa los prompts en inglés. Los ejemplos de esta guía están escritos en ese idioma para que se puedan copiar y usar directamente.
Ejemplo de prompt: "a desk setup with clean, minimal design with one laptop and soft lighting"
Primer principio: lenguaje preciso y concreto
Las palabras son el principal mecanismo de control. Adjetivos vagos como "beautiful" o "cool" le dan demasiada libertad al modelo; los descriptores específicos, en cambio, definen estructura, textura y estado de ánimo de forma directa.
Algunas comparaciones:
- Vago: "beautiful landscape"
- Preciso: "serene alpine lake at sunrise, soft golden hour lighting, low morning fog"
- Vago: "fast car"
- Preciso: "sleek red sports car racing on a wet highway at night, neon reflections, motion blur"
Hay que evitar los plurales vagos. "Flowers" deja la interpretación completamente abierta; "twelve flowers arranged in a circle on a stone table, overhead view" impone una cantidad exacta y un punto de vista concreto, lo que reduce la aleatoriedad.
Cambios mínimos de vocabulario producen resultados muy diferentes. Sustituir "elegant" por "gritty" o "minimal" por "ornate" modifica la composición, el contraste y la textura, porque el modelo asocia cada palabra con patrones visuales distintos. Vale la pena hacer pruebas con variaciones pequeñas — incluso cambiar un solo adjetivo — para entender la sensibilidad del modelo.
Segundo principio: describir lo que se quiere (y usar --no con moderación)
Las frases negativas introducen conceptos no deseados. Escribir "no clutter" o "without people" sigue activando esas ideas en el modelo, y es habitual que aparezcan rastros de lo que se quería excluir.
Débil: "a desk setup with no clutter" Fuerte: "a clean, minimal desk setup with one laptop, empty white desk, soft window light, neutral wall"
El parámetro --no ofrece un método de exclusión más fiable. Se recomienda usarlo para elementos que persisten a pesar de reformular el prompt:
- --no text — elimina palabras o etiquetas no deseadas
- --no people — mantiene las escenas vacías
- --no clouds — despeja el cielo
Este parámetro aplica una máscara de exclusión durante la generación, aunque en ocasiones pueden aparecer trazas de todos modos. Su función es complementar descripciones afirmativas, no sustituirlas.
Ejemplo para gráficas de redes: "minimalist quote poster, centered typography, solid pastel background, --no photo"
Tercer principio: acumular detalles con coherencia
Apilar demasiados estilos o condiciones contradictorias obliga al modelo a mezclar señales incompatibles, lo que produce resultados confusos.
Sobrecargado: "cinematic oil painting ultra realistic 3D render watercolor sketch of a city at night at noon"
Coherente: "cinematic oil painting of a rainy neon city street at night, reflections on wet pavement, dramatic contrast"
Un prompt coherente suele centrarse en un sujeto, un medio, un estado de ánimo, un momento del día y una referencia de estilo consistente. Antes de generar, conviene revisar que el prompt hable con una sola voz: sin puntos de vista contradictorios, sin fuentes de luz incompatibles, sin combinaciones imposibles.
Iterar vale más que redactar el prompt perfecto de entrada. Los profesionales refinan en 3 o 5 ciclos de ajustes de adjetivos y parámetros, en lugar de intentar incluirlo todo en un solo intento.
Estructura base para construir prompts
Estos siete componentes aplican a casi cualquier tipo de imagen:
- Sujeto: quién o qué aparece (persona, animal, objeto, lugar)
- Medio: en qué formato (foto digital, pintura al óleo, ilustración, render 3D, boceto a carboncillo)
- Entorno: dónde (interior, exterior, bajo el agua, espacio, calle urbana)
- Iluminación: de qué tipo (hora dorada, vela suave, sol cenital, luz de neón)
- Color: qué paleta (pasteles suaves, primarios intensos, tonos cálidos, escala de grises, monocromático)
- Estado de ánimo: qué sensación (enérgico, misterioso, tranquilo, lúdico, inquietante)
- Composición: cómo se encuadra (retrato, primer plano, plano general, vista cenital)
Ejemplo completo con los siete elementos: "portrait photo of an elderly jazz musician, indoor bar environment, warm golden hour window light, rich amber and teal colors, nostalgic calm mood, close-up composition, shallow depth of field"
Se recomienda usar esta estructura como plantilla mental: un solo medio, un estado de ánimo dominante, y que cada elección sea intencional, no acumulada.
Iluminación: la forma más rápida de cambiar el estado de ánimo
En Midjourney, las palabras de iluminación modifican la emoción, la profundidad y el foco de forma más drástica que casi cualquier otro elemento.
Dirección de la luz:
- Luz frontal: iluminación uniforme, sin sombras pronunciadas — limpio, poco dramático, ideal para productos
- Luz lateral: agrega sombras, contraste y textura — dramático, escultórico, excelente para retratos
- Contraluz: produce efectos de halo y silueta — atmosférico, cinematográfico, separa el sujeto del fondo
Contraste de sombras:
- Sombras suaves (cielo nublado, softbox): gentiles, naturales, accesibles
- Sombras duras (sol directo, foco): alta tensión dramática, definición nítida
Longitud de las sombras:
- Sombras cortas (sol alto): ambiente luminoso y minimalista
- Sombras largas (horizonte bajo): profundidad, dirección y efecto cinematográfico
Misma escena, distinta iluminación:
- "city street on a cloudy day with soft diffused light" — neutral, accesible
- "city street at golden hour with long shadows and strong rim light" — dramático, narrativo
Relaciones de aspecto y tamaño de imagen
El tamaño de imagen en Midjourney se define principalmente por la relación de aspecto, que se establece con --ar. Este parámetro es una de las primeras restricciones que usa el modelo para imaginar la escena: define la composición antes de que se rendericen los detalles.
| Proporción | Uso recomendado |
| 1:1 | Productos centrados, avatares, publicaciones en líneas y columnas |
| 3:2 | Paisajes, cabeceras de blog, galerías web |
| 4:3 | Fotos tradicionales, correo electrónico, presentaciones |
| 2:3 / 3:4 | Retratos, pósters, portadas editoriales |
| Proporción | Uso recomendado |
| 19:9 / 2:1 | Banners cinematográficos, miniaturas de YouTube, panorámicas |
| 9:19 / 5:6 | Reels, TikTok, Stories, anuncios verticales |
| 1:2 | Tomas de moda verticales, pósters impactantes |
Ejemplos:
- "minimalist product photo of a glass skincare bottle, studio lighting, neutral background, --ar 1:1"
- "panoramic mountain landscape at sunrise, --ar 2:1"
Conviene definir la plataforma de destino antes de generar (hero web, grilla de Instagram, story vertical) y establecer la relación de aspecto desde el principio del prompt.
Ángulos de cámara y puntos de vista
El punto de vista le indica a Midjourney dónde se ubica el espectador en la escena. El ángulo de cámara define la emoción antes de que la iluminación o el color entren en juego.
Ángulos principales:
- Eye-level — natural, realista
- Low angle — poderoso, heroico, dramático
- High angle — visión de conjunto, efecto flat-lay
- Wide shot — contexto, entorno, narrativa
- Close-up — emoción, intimidad, detalle
- Bird's-eye view — estructura, patrones, disposiciones
| Sujeto | Punto de vista recomendado |
| Productos | a nivel de los ojos o ligeramente cenital |
| Retratos | a nivel de los ojos por realismo, ángulo bajo por impacto |
| Arquitectura | Ángulo bajo por escala, campo amplo por contexto |
| Redes sociales | Primeros planos, ángulos estéticos altos |
Ejemplo: "bird's-eye view of a minimalist office desk, overhead flat-lay, soft morning light"
El punto de vista debería ser una de las primeras decisiones, no un ajuste de último momento para corregir problemas de composición.
Estilo, referencias y parámetros de estilo
El estilo determina cómo se siente y comunica una imagen. Surge de la combinación de color, textura, contraste, formas y nivel de detalle — cualidades que moldean la percepción más allá del sujeto representado.
Midjourney ofrece varios sistemas de estilo:
- Style References mediante --sref (URL de imagen) y --sw (intensidad 0-1000): permiten replicar un lenguaje visual o moodboard en múltiples imágenes
- Omni Reference (--oref con peso --ow): mantiene la consistencia de personajes y objetos a través de escenas — esencial para series y narrativas
Se recomienda definir 1 o 2 estilos visuales por proyecto (por ejemplo, "ilustración editorial en pasteles suaves" vs. "fotografía cinematográfica de alto contraste") y mantenerlos con consistencia. La coherencia visual construye reconocimiento de marca en las imágenes generadas.
Parámetros principales: realismo, estilización, caos y rareza
Los parámetros no cambian el contenido de la escena — cambian cómo Midjourney interpreta y renderiza el prompt.
--style raw (o --raw): Reduce la estilización predeterminada de Midjourney para una interpretación más literal. Ideal para fotografía comercial, tomas de producto y branding limpio donde la deriva artística hace más daño que bien.
--s (stylize): El valor predeterminado es 100. Valores bajos (0-50) producen imágenes más literales y realistas con mínima interpretación artística. Valores altos (200-1000) generan resultados más expresivos — aunque en los extremos el prompt puede perder peso.
--c (chaos): Valores bajos (0-10) producen resultados predecibles y similares entre sí. Valores más altos introducen composiciones variadas — útil para explorar conceptos o para materiales de marketing donde se busca sorpresa.
--w (weirdness): Aumenta las interpretaciones experimentales e inesperadas. Potente para visuales de marketing metafórico, pero hay que usarlo con cuidado: la rareza debe apoyar el mensaje, no confundirlo.
Fotografía de producto en Midjourney
Las imágenes de producto requieren legibilidad inmediata, sensación premium y cero distracciones — similar a una sesión de fotografía en estudio real.
Principios clave:
- Un sujeto claro, fondo mínimo
- Iluminación que revele la forma y el material (vidrio, metal, plástico mate)
- Composición centrada o deliberadamente desplazada, nunca desordenada
- Estilización y caos bajos para claridad comercial
Fórmula de prompt: "minimalist product photo of a glass skincare bottle, placed on a clean white surface, soft diffused studio lighting, neutral background, professional studio photography, --ar 1:1 --style raw --s 50 --c 5 --no text --no props"
Variaciones de iluminación:
- "dramatic softbox lighting from the left" — agrega dimensión, sensación premium
- "soft side lighting" — revela textura, reduce la dureza
Conviene imaginar primero el setup de estudio real (posición de luz, distancia de cámara, material del fondo) y traducir esa imagen mental al prompt. Instrucciones como "centered composition" y exclusiones como --no props mantienen el enfoque ajustado.
Visuales de marketing que destacan
Los visuales de marketing priorizan el impacto emocional y la capacidad de detener el scroll, por encima del realismo estricto. En un feed saturado, la imagen tiene segundos para comunicar valor.
Características clave:
- Contraste fuerte y luz direccional
- Composición dinámica (sujetos descentrados, diagonales, ángulos inusuales)
- Metáfora clara o idea focal vinculada a la marca
- Caos y rareza moderados para generar originalidad
Plantilla de prompt: "dramatic marketing visual of a steaming coffee cup rising like a sunrise over a city skyline, strong rim light, high contrast, warm orange and deep blue colors, low angle, --ar 16:9 --s 200 --c 25 --w 15"
Aumentar --c favorece composiciones frescas; un --w controlado produce metáforas memorables sin descarrilar el concepto. Se recomienda probar 3 o 4 variaciones por concepto — cambiar ángulo, iluminación o paleta antes de cerrar la imagen de campaña.
Imágenes para blogs y redes sociales
Las imágenes editoriales y sociales acompañan la lectura sin opacarla. Funcionan mejor cuando visualizan metáforas en lugar de ilustrar titulares de forma literal.
En vez de pedir "work-life balance", conviene describir una escena física que encarne la idea: "two contrasting workspaces, one chaotic and one calm, split frame composition."
Ejemplos:
- "minimalist illustration of two contrasting city halves, one in cool blue night colors, one in warm morning light, clean vector style, --ar 3:2"
- "overhead photo of a desk divided diagonally, one side cluttered, one side clean with a single laptop and notebook, soft daylight, --style raw"
Hay que hacer coincidir la relación de aspecto con el canal: 3:2 o 4:3 para cabeceras de blog, 1:1 para posts de feed, 9:16 para Stories. Incluir detalles humanos pequeños — migajas, herramientas, vapor, reflejos — da a las imágenes una sensación habitada en lugar de genérica.
Contenido local y Stories: mostrar cómo se siente estar ahí
Para negocios locales — cafeterías, gimnasios, estudios, salones — el objetivo es transmitir atmósfera y rutina, no solo productos. Se trata de mostrar cómo se siente estar en ese lugar.
Es útil centrar los prompts en momentos específicos:
- Mañanas temprano antes de abrir
- Pausas tranquilas entre clientes
- Herramientas y texturas (harina, vapor, sillas apiladas)
- Luces cálidas de interior contra el amanecer frío del exterior
Ejemplos:
- "cozy neighborhood bakery at 6am, baker's hands dusted with flour shaping bread, warm golden light from the oven, shallow depth of field, --ar 9:16"
- "barista preparing espresso before opening, empty café, chairs upside down on tables, cool blue dawn light outside, warm interior lights, --style raw"
El contenido vertical y los Stories se benefician de primeros planos y puntos de vista a escala humana. Reutilizar prompts exitosos con ajustes pequeños (hora del día, estación, accesorios) permite construir una narrativa visual coherente a lo largo de semanas sin empezar desde cero cada vez.
Mundos visuales y narrativas con Omni Reference
La ilustración de largo aliento — novelas gráficas, cómics, series de contenido — requiere consistencia a lo largo de muchas imágenes generadas en el tiempo. Los personajes y el mundo deben ser reconocibles de escena en escena.
Flujo de trabajo con Omni Reference:
- Generar un retrato ancla que defina al protagonista con estilo y nivel de detalle específicos
- Usar esa imagen como referencia omni al escribir nuevas escenas mediante --ow (peso omni, valor predeterminado 100, rango 0-1000)
- A medida que las escenas se vuelven más expresivas (iluminación más intensa, caos más alto), aumentar --ow para proteger la identidad del personaje
Conviene construir una "columna vertebral de prompt" que se reutilice: mismo lenguaje de estilo, referencia de personaje, nivel de detalle. Solo cambia el estado de ánimo, el punto de vista y el entorno de capítulo en capítulo. Cuando los lectores reconocen a un personaje antes de pensarlo conscientemente, el sistema funciona.
Iteración y refinamiento: del borrador a la imagen final
Los resultados con aspecto profesional provienen de varias iteraciones de prompt, no de un comando perfecto a la primera.
Ciclo iterativo simple:
- Primera pasada: concepto amplio con sujeto básico, iluminación y relación de aspecto
- Segunda pasada: refinar adjetivos, especificar punto de vista, agregar --no para elementos no deseados
- Tercera pasada: ajustar estilización, caos o rareza para afinar el realismo o la experimentación
Conviene guardar los resultados más logrados como referencias de estilo o de personaje para prompts futuros. Incluso cambios pequeños ("soft light" vs. "harsh light", "muted palette" vs. "vibrant colors") merecen probarse.
La iteración no es un fracaso — es el proceso creativo central cuando se trabaja con cualquier generador de imágenes con IA.
Prompts prácticos de Midjourney listos para reutilizar
Se pueden copiar estas plantillas y modificar un elemento a la vez para ganar confianza:
Fotografía de producto: "minimalist product photo of a ceramic coffee mug, placed on a clean marble surface, soft diffused studio lighting, neutral background, professional studio photography, --ar 1:1 --style raw --s 50 --c 5 --no text --no props"
Visual de marketing: "dramatic marketing visual of a runner breaking through morning fog at sunrise, strong rim light, high contrast, warm orange and deep purple colors, low angle, --ar 16:9 --s 200 --c 25 --w 15"
Metáfora editorial/blog: "overhead photo of a desk divided diagonally, one side cluttered with papers and coffee cups, one side clean with a single laptop, soft window daylight, --ar 3:2 --style raw"
Atmósfera de negocio local: "cozy coffee shop at 6:30am, barista arranging pastries in display case, warm interior lights against blue dawn outside, shallow depth of field, --ar 9:16"
Ilustración de personaje/historia: "fantasy portrait of a young alchemist with silver hair and amber eyes, warm candlelit laboratory, glass vials glowing green, painterly style, --ar 2:3 --s 150" (usar como retrato ancla y referenciar con --oref en escenas posteriores)
Estas son puntos de partida. Se recomienda modificar iluminación, ángulo o relación de aspecto de a un elemento por vez.
Preguntas frecuentes
¿Cuándo conviene usar Discord y cuándo la interfaz web?
Discord sigue siendo potente para experimentación rápida, interacción con la comunidad y flujos tradicionales de /imagine donde se quiere explorar ideas con rapidez entre los prompts de millones de otros usuarios. La interfaz web centraliza las herramientas de edición — panning, zooming, inpainting — en un espacio de trabajo visual más adecuado para el refinamiento detallado.
Para quienes empiezan, se recomienda la web por su claridad; Discord se puede adoptar luego para prompting rápido o colaboración. Ambas plataformas se sincronizan mediante cuentas vinculadas, por lo que imágenes y configuraciones se mantienen consistentes.
¿Cuántas palabras debe tener un buen prompt?
No hay un límite estricto, pero entre 15 y 40 palabras enfocadas suelen funcionar mejor — suficiente para cubrir sujeto, medio, iluminación, color, estado de ánimo y composición sin introducir contradicciones. Si el prompt supera dos o tres oraciones cortas, conviene revisar si hay detalles redundantes o conflictivos.
Es mejor dividir ideas complejas en múltiples imágenes que sobrecargar un solo prompt. La precisión y la coherencia importan más que la extensión.
¿Se pueden usar las imágenes de Midjourney comercialmente?
Los términos de servicio de Midjourney regulan el uso comercial. Las suscripciones de pago generalmente permiten aplicaciones comerciales, pero siempre conviene revisar los términos de licencia más recientes en el sitio oficial antes de usar imágenes en anuncios, packaging o productos.
Las políticas cambian con el tiempo, y el uso que involucra marcas registradas, semejanzas de personas o temáticas sensibles puede requerir revisión adicional. Esta guía se centra en la creación y el control, no en asesoramiento legal.
¿Cómo se hace que Midjourney respete la identidad visual de una marca?
Primero hay que definir una "receta de estilo" de marca: paleta de colores, nivel de contraste, preferencias de textura, iluminación típica — y aplicar esos elementos de forma consistente en cada prompt. Para consistencia visual se usan referencias de estilo (--sref y --sw).
Conviene crear una biblioteca interna de 5 a 10 imágenes de "look aprobado" y reutilizarlas como anclas visuales. Para personajes o mascotas recurrentes, las referencias Omni con valores --ow ajustados ayudan a mantener la identidad a través de las variaciones.
¿Qué se hace si Midjourney sigue añadiendo objetos o texto no deseados?
Primero, hay que reformular en positivo y con especificidad ("empty white background" en lugar de "no background"). Luego, se agregan parámetros --no para los elementos persistentes: --no text, --no logos, --no extra people.
Reducir ligeramente el caos y la estilización (--c y --s) disminuye los elementos inesperados. Si aún aparecen artefactos, el inpainting o la edición básica en software externo como Adobe Firefly resuelve los detalles finales más rápido que regenerar indefinidamente.
Changed