ChatGPT Images 1.5: així és el gran salt en imatges d'OpenAI

  • ChatGPT Images estrena el model GPT Image 1.5, fins a quatre vegades més ràpid i amb millor seguiment d'instruccions.
  • La nova eina permet edicions precises sobre fotos pujades, mantenint il·luminació, composició i trets facials.
  • Millora notable en la generació de text dins de les imatges i en escenes complexes amb moltes cares o detalls petits.
  • OpenAI llança una secció pròpia d'Imatges a ChatGPT, ja disponible per a la majoria d'usuaris i via API.

ChatGPT Images

La generació d'imatges amb intel·ligència artificial ha esdevingut un dels aparadors més visibles de la carrera entre gegants tecnològics. OpenAI ha decidit moure fitxa amb una actualització profunda de ChatGPT Images, el seu sistema integrat de creació visual, en un context en què models com Nano Banana Pro de Google estaven acaparant bona part de la conversa.

Amb aquest llançament, la companyia responsable de ChatGPT vol que la seva eina deixi de ser un simple afegit dins del xat per passar a funcionar com un autèntic estudi creatiu integrat, més ràpid, més precís i amb una interfície pensada des de zero per treballar amb imatges en lloc de limitar-se al text.

Nou model GPT Image 1.5: velocitat i precisió per bandera

El cor de l'actualització és GPT Image 1.5, el nou model insígnia d'OpenAI per a imatges. L'empresa assegura que és capaç de generar contingut visual fins quatre vegades més ràpid que la versió anterior, cosa que a la pràctica es nota especialment durant les hores punta i en dispositius mòbils, on abans no era estrany que el procés es tallés o es fes etern en canviar d'aplicació.

A més del rendiment, la millora clau és el seguiment d'instruccions. El sistema interpreta amb més fidelitat prompts complexos i relacions espacials precises, de manera que peticions com canviar només un objecte, ajustar la il·luminació o modificar la roba d'una persona ja no arrosseguen canvis inesperats a la resta de l'escena.

OpenAI explica que GPT Image 1.5 ha estat entrenat per mantenir constants elements crucials de la imatge, com ara la identitat facial, la composició general o la paleta cromàtica, fins i tot després de diverses rondes d'edició encadenada. Aquest punt és especialment rellevant per a usos professionals, on la consistència visual no és caprici, sinó un requisit.

Edició puntual i en cadena: canviar només allò que interessa

Un dels punts on més fluixejaven els models anteriors era la edició puntual d'àrees concretes. Canviar un barret, retocar la il·luminació o afegir un element al fons podien acabar remesclant tota l'escena. El nou ChatGPT Images apunta directament a aquest problema.

El model és capaç de afegir, eliminar, combinar, barrejar i transposar elements dins una mateixa imatge mantenint estables la resta de components importants. A la pràctica, això es tradueix a demanar accions del tipus: canviar el color d'una camisa, modificar la gorra, ajustar un senyal de trànsit o transformar un camió en un camió de bombers sense que la resta de l'entorn es desfiguri.

També s'ha reforçat el comportament a les trucades edicions en cadena. Fins ara, un tercer o quart canvi solia provocar que el model “reinventés” la imatge del tot. Amb GPT Image 1.5, l'eina conserva amb molta més fiabilitat l'estil, la posició i l'escena, de manera que es pot iterar sobre la mateixa base sense haver de començar des de zero a cada modificació.

Transformacions creatives: del selfie al pòster de cinema

Més enllà de la precisió tècnica, OpenAI està empenyent ChatGPT Images cap a un terreny clarament creatiu. El sistema permet pujar una fotografia pròpia i, amb un prompt relativament senzill, obtenir en qüestió de segons versions transformades creïbles: des d'un anunci publicitari dels anys 90 fins a una escena a Times Square a ple hivern o una ciutat japonesa d'estètica cyberpunk.

El model també és capaç de recrear estils artístics concrets, com a pòsters de cinema clàssic, il·lustracions a l'estil animi o composicions d'aspecte històric, respectant trets clau de la persona original. La idea és que l'usuari es pugui “veure” en contextos molt diferents, sense perdre la sensació que es tracta del mateix subjecte.

Aquest enfocament recorda el que ja oferien models com Nano Banana, però OpenAI intenta diferenciar-se apostant per transformacions conceptuals més controlades, on el sistema manté l'essència de la foto base mentre canvia roba, entorn, il·luminació o època amb força coherència visual.

ChatGPT Images s'acomiada de l'estil groguenc i millores en escenes complexes

Durant molt de temps, era relativament senzill identificar si una imatge havia estat creada amb les primeres versions de ChatGPT: predominaven tons càlids, acabats cremosos i certa dominant groga que delataven l?origen artificial. A les comparatives internes que mostra OpenAI i en proves independents, i davant d'alternatives com Creador d'imatges de Bing, aquest tret sembla haver quedat enrere.

El nou model ofereix un espectre cromàtic més neutre i variat, apropant-se més a l'aspecte de fotografies convencionals tret que l'usuari demani explícitament el contrari al prompt. Això ajuda a fer que les imatges resultin menys “marca de la casa” i més útils en contextos on es busca realisme o integració amb material fotogràfic ja existent.

També s'han introduït millores en la representació de escenes amb molts elements petits, com multituds o fons carregats de detalls. Les cares de grups nombrosos es mostren ara més diferenciades entre si, amb posis i expressions més naturals, i es redueixen errors típics en mans, traços minúsculs o repeticions estranyes.

ChatGPT Images permet introduir text dins de les imatges: salt en cartells, infografies i maquetes

La generació de text llegible dins una imatge ha estat històricament un dels talons d'Aquil·les de la IA generativa. OpenAI assegura que GPT Image 1.5 fa un pas important en aquest front, amb una renderització de tipografia molt més consistent que en versions anteriors.

El model pot manejar blocs de text densos i de mida petita, cosa que obre la porta a crear cartells, infografies, maquetes de pàgines de diari o dissenys amb taules i formats tipus markdown amb un nivell de llegibilitat que, sense ser perfecte, s'acosta més a una cosa utilitzable sense retocs intensius.

Per als que treballen en màrqueting, educació, comerç electrònic o contingut digital, aquesta millora suposa reduir el temps dedicat a corregir lletres deformes o paraules incompletes. En contextos on cal produir materials visuals amb missatges clars i llestos per a la seva publicació, el fet que el propi model generi text raonablement net es converteix en un element diferenciador.

Una nova experiència d'ús: secció pròpia d'Imatges a ChatGPT

L'actualització no es queda al model; també afecta la forma de fer-lo servir. OpenAI ha afegit a la barra lateral de ChatGPT una secció específica anomenada “Imatges”, tant a l'aplicació mòbil com a la versió web. L'objectiu és separar l'experiència visual del xat tradicional i facilitar l'exploració als que no es volen barallar amb prompts complexos.

Des d'aquest espai nou, l'usuari troba estils predefinits, suggeriments de tendències i plantilles per a tasques freqüents com crear felicitacions, restaurar fotos antigues, alternar entre estils artístics diferents o generar variacions d'un mateix producte. Aquest plantejament redueix la barrera dentrada per a persones sense experiència tècnica.

Un altre aspecte pràctic és que la secció d'Imatges actua com repositori centralitzat de totes les creacions visuals de lusuari. Des d'aquí és més senzill revisar versions anteriors, repetir un estil amb nous continguts o continuar l'edició d'una imatge ja generada, especialment útil en fluxos de treball continus.

De complement cridaner a eina de treball visual

La mateixa OpenAI reconeix que, fins ara, la generació d'imatges dins de ChatGPT funcionava més com un extra cridaner dins d'una interfície pensada per a text que com un entorn de treball visual sòlid. Amb aquesta actualització, la companyia intenta fer un salt qualitatiu: passar d'imatges “de prova” per a xarxes socials a una eina utilitzable en processos reals.

La millora en consistència i iteració té impacte directe en sectors com disseny, màrqueting, comerç electrònic o branding. Empreses que necessiten adaptar una mateixa creativitat a múltiples formats, provar variants d'un producte o mantenir la fidelitat de logotips i elements corporatius al llarg de centenars de peces troben en aquest tipus de control un avantatge clar.

Plataformes creatives que operen a Europa, com a editors web i eines de disseny al núvol, ja estan integrant aquests models als seus fluxos. En aquest terreny, l'aposta d'OpenAI per un entorn visual més complet pot encaixar tant a pimes que busquen accelerar la producció de materials gràfics com en equips de comunicació interna de grans corporacions.

Disponibilitat de ChatGPT Imatges per a usuaris, empreses i desenvolupadors

OpenAI ha començat a desplegar el nou ChatGPT Images per la majoria d'usuaris de la plataforma, inclosos els gratuïts. Molts ja es troben amb un avís en obrir l'app que convida a provar la funció d'imatges, i amb la nova pestanya dedicada al menú lateral per centralitzar-ne l'ús.

A l'àmbit empresarial, la companyia ha confirmat que l'accés avançat per a comptes Business i Enterprise s'anirà incorporant de forma progressiva, amb el focus en integracions dins de fluxos de treball professionals. Per a organitzacions europees que ja usen ChatGPT en tasques internes, això suposa poder ampliar l'ús des del text cap a material gràfic generat sota les mateixes credencials.

En paral·lel, GPT Image 1.5 està disponible a través de la API d'OpenAI, el que permet a desenvolupadors integrar les capacitats de generació i edició d'imatges a les seves pròpies aplicacions. L'empresa indica que el cost d'entrada i eixida d'imatges és aproximadament un 20 % inferior al del model anterior, un detall rellevant per a projectes a gran escala o serveis que operen amb marges ajustats.

Competència amb Nano Banana Pro i altres models visuals

El moviment d'OpenAI arriba en un moment de forta pressió competitiva. Google ha impulsat Nano Banana Pro com un dels models generatius visuals de referència, integrat al seu ecosistema d'eines creatives i vinculat al seu família Gemini, cosa que ha disparat el seu ús a nivell global.

Aquesta situació ha fet que, en alguns serveis de la competència, s'estableixin límits estrictes per a usuaris gratuïts, per exemple reduint el nombre d'imatges que es poden generar al dia, en part per l'elevada demanda. Davant d'això, OpenAI sembla apostar per una combinació d'abast ampli, més rapidesa i un entorn d'edició més fi per retenir i atraure usuaris.

En paral·lel, altres actors com xAI amb el seu chatbot Grok o diferents models especialitzats en imatge estan empenyent que la generació visual es converteixi en un front central de la batalla per latenció dels usuaris. L'estratègia d'OpenAI passa per consolidar ChatGPT com a “aplicació per a tot”, en què cerca, veu, text, imatges i vídeo conviuen en un mateix punt d'entrada.

Amb aquest nou ChatGPT Images, OpenAI fa un pas important cap a una eina visual més madura: un model més veloç i precís, una interfície diferenciada i capacitats d'edició que apunten clarament al treball real, tant en contextos personals com a professionals. Falta veure fins a quin punt aquestes millores es consoliden en el dia a dia d'usuaris i empreses a Espanya i Europa, però el missatge és clar: la imatge deixa de ser un afegit simpàtic del xat per convertir-se en una peça central de l'ecosistema ChatGPT.

ChatGPT creant imatges
Article relacionat:
ChatGPT ara genera imatges amb GPT-4o: tot el que cal saber

Afegir com a font preferida a Google