La edición basada en referencias empieza con una decisión: ¿qué partes de la fuente deben conservarse y cuáles pueden cambiar? Un equipo de producto puede querer un entorno nuevo alrededor de la misma botella. Un diseñador puede necesitar combinar tres referencias en una sola escena. Un equipo de marca puede querer una composición que conserve texto legible o un recurso vectorial editable. Son trabajos de edición diferentes.
GPT Image 2, FLUX.2 y Recraft V4 pueden trabajar a partir de una entrada visual, pero exponen superficies de control distintas. GPT Image 2 encaja en ediciones iterativas y máscaras. FLUX.2 encaja en la composición con múltiples referencias y el control del color. Recraft V4 encaja en la generación de imágenes y vectores orientada al diseño, con una edición más limitada de lo que sugieren sus resultados pulidos.
Esta comparación aplica el mismo marco de decisión a los tres: fidelidad de la referencia, aislamiento del cambio, adecuación de la salida, coste de revisión y disponibilidad. No trata a un modelo como ganador universal.

La respuesta breve
| Modelo | Mejor punto de partida | Superficie de referencias y edición | Resultado y disponibilidad | Principal limitación |
|---|---|---|---|---|
| GPT Image 2 | Conservar un sujeto mientras cambias su entorno o sus detalles | Varias referencias de imagen, ediciones con prompts, máscaras y edición en varias rondas | Disponible en el catálogo actual de imágenes de Whisk IA, con opciones 1K, 2K y 4K | El texto exacto, la composición y los detalles de marca recurrentes aún necesitan revisión |
| FLUX.2 | Combinar varias referencias en una escena coherente | Una imagen principal más referencias adicionales, uso del estilo, orientación de proporciones y control del color | API externa y playground; salida de hasta 4MP | Elegir el endpoint, gestionar el sondeo asíncrono y asumir el coste según la resolución exige planificación |
| Recraft V4 | Crear recursos rasterizados o vectoriales orientados al diseño | Imagen a imagen con un valor de intensidad, además de generación de diseños y vectores | Aplicación y API de Recraft; V4 Pro apunta a trabajos de mayor resolución | La página del modelo V4 indica que la edición basada en prompts, los conjuntos de imágenes y el control del nivel artístico no son compatibles |
Para un producto conocido, empieza por el modelo que facilite describir el siguiente cambio. El primer borrador importa, pero normalmente la cuarta revisión determina si un flujo merece un lugar en producción.
Qué mide la edición basada en referencias
La edición basada en referencias es más que subir una imagen y añadir un prompt. El conjunto de entradas suele contener una imagen fuente, una o más referencias visuales, una solicitud de cambio y un requisito de salida. El modelo debe interpretar las relaciones entre esas entradas.
Usa estas preguntas antes de comparar resultados:
- ¿Qué debe seguir siendo reconocible? La forma del producto, el rostro, la prenda, el material o la identidad del sujeto.
- ¿Qué debe cambiar? El fondo, la iluminación, los accesorios, el tratamiento de color, el recorte o el área de texto.
- ¿Cuántas referencias tienen funciones diferenciadas? Una imagen fuente plantea un problema distinto al de una fuente más tres referencias de material y estilo.
- ¿Cuál es la siguiente edición? Una corrección local, una escena nueva, una relación de aspecto nueva o una variación de diseño completa.

| Dimensión de revisión | Pregunta que debes responder | Evidencia que debes registrar |
|---|---|---|
| Fidelidad de la referencia | ¿El resultado conserva las partes de la fuente que importan al comprador? | Silueta, proporciones, superficie y marcas importantes |
| Aislamiento del cambio | ¿Cambió el área solicitada sin desviaciones colaterales? | Comparación del antes y el después alrededor de la edición |
| Uso de la referencia | ¿Puedes identificar la referencia de escena, material o estilo proporcionada en el resultado? | Indicios de color, iluminación, textura y composición |
| Adecuación de la salida | ¿Puede la imagen pasar al siguiente paso de producción? | Relación de aspecto, resolución, formato y espacio útil para texto |
| Coste de revisión | ¿Puede un compañero describir el siguiente cambio sin empezar de nuevo? | Tiempo, créditos, intentos y sustituciones de entradas |
GPT Image 2: el editor iterativo
GPT Image 2 acepta texto e imagen como entrada y devuelve una imagen. Su superficie de edición abarca imágenes nuevas creadas a partir de referencias, ediciones de imágenes existentes y cambios con máscara en una parte seleccionada de una imagen. Una ruta conversacional independiente admite la edición en varias rondas, de modo que el equipo puede perfeccionar la misma dirección en lugar de repetir todo el encargo en cada pasada.
Eso convierte GPT Image 2 en una opción sólida para una instrucción como: conserva la botella, el tapón y el ángulo de cámara; sustituye el fondo de piedra por un set de papel cálido; deja espacio libre a la derecha para un titular. Una máscara puede acotar la edición cuando deba cambiar el fondo mientras el sujeto permanece intacto.
El catálogo actual de imágenes de Whisk IA expone GPT Image 2 tanto en los modos texto a imagen como imagen a imagen. Su entrada imagen a imagen acepta hasta 16 imágenes de referencia, con un límite de 10 MB por imagen, y ofrece controles de relación de aspecto y resolución de 1K, 2K o 4K. El catálogo parte de 10 créditos para el modelo y aplica un multiplicador mayor a la salida en 2K y 4K. Esta es la vía disponible en Whisk IA para probar GPT Image 2 sin crear un cliente de API independiente.
GPT Image 2 también tiene límites claros. La colocación precisa del texto, la composición exacta, los fondos transparentes y los elementos de marca repetidos merecen una revisión independiente. El modelo puede producir un concepto convincente mientras cambia una etiqueta, una marca pequeña o un detalle recurrente de un personaje. Trata esos detalles como objetivos de revisión, no como prueba de conservación a nivel de píxel.
Elige GPT Image 2 cuando:
- Una sola imagen fuente contiene la identidad importante.
- El equipo espera varias revisiones del prompt.
- Una máscara o edición local puede reducir el alcance de un cambio.
- Quieres probar el modelo dentro del espacio de trabajo de Whisk IA.
FLUX.2: el compositor de múltiples referencias
FLUX.2 está diseñado para un conjunto de referencias con varias funciones diferenciadas. Su API de edición acepta una input_image principal y referencias adicionales opcionales mediante input_image_2 a input_image_8. El playground admite hasta 10 referencias. Esa estructura encaja con un encargo que combina un sujeto, un material, una ubicación, una dirección de iluminación y una muestra de estilo en una sola escena.
La familia de modelos también ofrece opciones explícitas de producción. Las variantes klein priorizan la velocidad, max apunta a la máxima calidad, pro equilibra el uso en producción y flex enfatiza controles como la tipografía. Los endpoints de vista previa incorporan las últimas mejoras, mientras que los endpoints fijados permiten ejecuciones más reproducibles. La edición de FLUX.2 alcanza hasta 4MP e incluye una guía de color que puede llevar colores exactos de marca al prompt y al conjunto de referencias.
El precio de ese control es la orquestación. Una solicitud de API devuelve una URL de sondeo y el resultado llega de forma asíncrona. La URL firmada del resultado dura un periodo limitado, por lo que una integración de producción debe recuperar o conservar la salida con rapidez. Los precios también cambian según el modelo y la resolución de salida. Para un conjunto de campaña, registra el endpoint, la resolución, el orden de las referencias y el prompt junto con cada resultado.
Elige FLUX.2 cuando:
- Varias referencias deben aportar ingredientes visuales distintos.
- Los colores exactos y las proporciones relativas importan más que la revisión conversacional.
- El equipo puede gestionar una API asíncrona y quiere un endpoint fijado.
- Una sola imagen fuente no puede expresar la escena completa.
FLUX.2 no es actualmente un modelo de generación en el catálogo de Whisk IA. Compáralo como opción de modelo externo y utiliza el mismo conjunto de referencias y la misma ficha de evaluación cuando juzgues su resultado frente a una ejecución de GPT Image 2 en Whisk IA.
Recraft V4: resultado orientado al diseño con un límite de edición
Recraft V4 aborda el trabajo desde la calidad del diseño. Su documentación del modelo enfatiza la composición equilibrada, el color cohesionado, el detalle refinado, el texto estructurado y la salida vectorial editable. V4 Pro apunta a trabajos rasterizados de mayor resolución, mientras que las variantes vectoriales V4 producen arte escalable. El precio publicado de la API es de $0.04 por imagen rasterizada V4, $0.25 para V4 Pro, $0.08 para V4 Vector y $0.30 para V4 Pro Vector.
Esas fortalezas importan para conceptos de packaging, carteles, iconos, menús y otros recursos donde el sistema visual forma parte de la entrega. Recraft V4 puede producir una dirección de diseño más terminada que una simple recombinación de escena, y la salida vectorial cambia la entrega para equipos que necesitan geometría editable.
La edición basada en referencias necesita una lectura más atenta de la documentación actual. La página del modelo V4 indica que la creación de estilos, la edición basada en prompts, los conjuntos de imágenes y el control del nivel artístico no son compatibles. La documentación del endpoint de API indica que imageToImage está disponible con los modelos rasterizados y vectoriales de Recraft V4 y utiliza un valor de strength de 0, casi idéntico a la fuente, a 1, con una similitud mínima. El inpainting y el outpainting siguen indicados para los modelos V3. Eso significa que la función de imagen a imagen de V4 es útil para variaciones amplias, pero no debe tratarse como la misma superficie de edición quirúrgica que una edición local con máscara.
Recraft V4 tampoco es un modelo de generación en el catálogo actual de Whisk IA. Whisk IA incluye un modelo independiente de procesamiento Recraft Crisp Upscale, que aumenta la resolución y la nitidez de la imagen. Esa entrada no ofrece la generación de Recraft V4 ni sus controles de diseño.
Elige Recraft V4 cuando:
- La composición, la tipografía, la ilustración o la entrega vectorial forman parte del encargo.
- Quieres un primer borrador orientado al diseño en lugar de un retoque limitado.
- Es aceptable una variación amplia de imagen a imagen.
- Puedes verificar la ruta de edición actual de V4 antes de comprometerte con un flujo de producción.
Elegir según el trabajo de edición
Conservar un producto mientras cambias su entorno
Empieza con GPT Image 2. Dale una fuente limpia, nombra los detalles invariantes y describe un cambio ambiental cada vez. En Whisk IA, usa el modo imagen a imagen y mantén la primera ejecución en una resolución manejable mientras pruebas la dirección. Para un encargo más amplio de Sujeto, Escena y Estilo, la guía existente sobre fotografía de producto con IA ofrece una separación de referencias útil.
Combinar varias referencias en una sola escena
Empieza con FLUX.2. Asigna una función a cada referencia, mantén estable el orden de las entradas y fija el endpoint cuando importe la repetibilidad. Un conjunto de referencias sin roles crea un problema de revisión más difícil porque no puedes saber qué entrada causó una desviación.
Crear una composición o un recurso vectorial
Empieza con Recraft V4. Úsalo cuando el texto legible, la composición equilibrada o la geometría escalable formen parte del resultado. Pasa el texto de alto valor y el lenguaje regulado por una revisión de diseño. Un modelo que entiende la composición aún puede producir una palabra incorrecta.
Conservar la precisión del catálogo
Usa la fotografía de producto aprobada como autoridad. Estos modelos pueden explorar un fondo, un recorte de campaña o una dirección estacional, pero los píxeles generados no deben definir dimensiones, ingredientes, afirmaciones ni texto obligatorio del empaque.
Ejecutar una prueba justa con tres modelos
Usa una botella ámbar sin marca, una idea de campaña serena y una relación de aspecto apaisada. Mantén constantes la fuente, el tamaño de salida, el número de intentos y los criterios de revisión. Después, ejecuta la misma secuencia:
- Cambia el entorno mientras conservas el producto.
- Añade una referencia de material o iluminación.
- Crea un recorte con espacio negativo claro para el texto.
- Intenta una corrección local o una variación controlada.
- Registra el tiempo, el precio o los créditos, la resolución de salida, los detalles fallidos y el siguiente cambio solicitado.
No compares un diseño pulido de Recraft con un primer borrador de GPT Image 2. Da a cada modelo la oportunidad de corregir su decisión más débil y después compara el esfuerzo necesario para alcanzar una dirección aprobada.
Puntuar la siguiente revisión
Una imagen atractiva aún puede fallar en su función. Revisa el resultado al tamaño en que lo verá el cliente y después compáralo con la referencia fuente.

| Dimensión | Condición de aprobación | Regenera o revisa cuando |
|---|---|---|
| Fidelidad del producto | La forma, el tapón, el material y las características importantes siguen siendo reconocibles | El sujeto cambia mientras el prompt pide editar la escena |
| Aislamiento del cambio | El área solicitada cambia y el área intacta permanece estable | Una edición del fondo cambia el producto o el recorte sin autorización |
| Uso de la referencia | La referencia de escena, estilo, color o material es visible en el resultado | El resultado adopta un aspecto genérico |
| Adecuación de la salida | La relación de aspecto, la resolución, el formato y el espacio para texto coinciden con el canal | El resultado necesita una segunda composición antes de que alguien pueda usarlo |
| Coste de la siguiente edición | El siguiente cambio tiene un único objetivo claro y un conjunto de entradas acotado | Hay que reconstruir todo el encargo para corregir un defecto |
Esta ficha de evaluación convierte la elección del modelo en una decisión de producción. GPT Image 2 puede reducir el coste de una revisión local o conversacional. FLUX.2 puede reducir el coste de ensamblar un conjunto de referencias complejo. Recraft V4 puede reducir el coste de entrega de un recurso de diseño. El precio más bajo de la primera generación no equivale al coste más bajo del proyecto.
En resumen
Elige GPT Image 2 para ediciones iterativas con referencias, máscaras y un sujeto que deba seguir siendo reconocible. Elige FLUX.2 para composición con múltiples referencias, control del color y reproducibilidad a nivel de endpoint. Elige Recraft V4 para resultados rasterizados o vectoriales orientados al diseño cuando una variación amplia sea aceptable y el límite de edición encaje con el encargo.
Para los usuarios de Whisk IA, GPT Image 2 es el modelo de esta comparación que el catálogo actual de imágenes expone para generación. Empieza en el espacio de trabajo de Whisk IA, mantén acotada la primera edición y revisa el resultado frente a la fuente antes de aumentar la resolución o añadir más referencias.
Preguntas frecuentes
¿Qué modelo es mejor para la edición de imágenes basada en referencias?
GPT Image 2 es el punto de partida más sólido para editar de forma iterativa un sujeto conocido. FLUX.2 encaja mejor cuando varias referencias deben convertirse en una sola escena. Recraft V4 encaja mejor cuando la calidad del diseño, el texto estructurado o la salida vectorial forman parte de la entrega.
¿Whisk IA ofrece los tres modelos?
No. El catálogo actual de generación de Whisk IA expone GPT Image 2. FLUX.2 y Recraft V4 no son modelos de generación seleccionables allí. Recraft Crisp Upscale está disponible como modelo independiente de procesamiento de imágenes, no como generación V4.
¿Puede Recraft V4 hacer ediciones locales precisas?
Procede con cautela. La documentación de la API de Recraft indica imagen a imagen de V4 con un control de strength, mientras que la página del modelo V4 indica que la edición basada en prompts no es compatible y reserva el inpainting y el outpainting para V3. Trata V4 como un modelo de diseño y variaciones hasta verificar la ruta exacta de edición para tu cuenta.
¿Una imagen generada debe convertirse en un packshot final de producto?
No sin una revisión del producto y la marca. Usa fotografía aprobada para las etiquetas exactas, las afirmaciones, las dimensiones y los detalles de cumplimiento. Usa estos modelos para explorar la dirección visual alrededor de esa fuente de verdad.