A OpenAI revelou o ChatGPT Images 2.0, um avançado sistema de criação de imagens que surge pouco mais de um ano após a introdução inicial desse recurso no chatbot. A companhia descreve essa atualização como um divisor de águas, ressaltando melhorias na execução de solicitações complexas, na renderização de textos elaborados e na disposição de objetos em diferentes cenários.
Raciocínio e autoavaliação
Em uma inovação significativa, a OpenAI afirma que agora possui um modelo capaz de raciocinar e buscar informações na internet, além de revisar suas próprias produções. Esses novos recursos aumentam a confiabilidade da ferramenta em situações que demandam precisão, consistência e coesão visual.
Progresso em idiomas não latinos
A companhia informou que dedicou esforços para aprimorar a compreensão e representação de textos em sistemas de escrita não latinos, destacando melhorias expressivas em idiomas como japonês, coreano, chinês, hindi e bengali. O modelo também consegue preservar com mais fidelidade características específicas das diversas linguagens visuais, tornando-se mais útil para atividades como prototipagem de jogos e desenvolvimento de storyboards.
Desempenho e flexibilidade
O novo sistema Images 2.0 oferece maior flexibilidade nas proporções das imagens, aceitando larguras que chegam até 3:1 e alturas até 1:3. Ele gera imagens com resoluções que podem alcançar até 2K e tem a capacidade de produzir até oito variações ao mesmo tempo. Em testes realizados pelo Electrek antes do lançamento oficial, o sistema foi desafiado a criar um “gato tartaruga” em estilo pixel art inspirado na terceira geração do Pokémon; o resultado foi considerado satisfatório ao capturar a estética dos jogos do Game Boy Advance e foi convertido para PNG com fundo transparente.
Durante os três testes mencionados, o sistema apresentou um tempo maior na segunda tarefa e gerou uma saída ligeiramente diferente da primeira. No entanto, conseguiu criar uma imagem transparente apropriada — uma tarefa muitas vezes complicada para outros modelos de geração de imagens.
Imagem: Divulgação
Reconhecimento das limitações
A OpenAI admite que o ChatGPT Images 2.0 “ainda não é perfeito”. O modelo pode enfrentar dificuldades em situações que exigem uma compreensão física precisa do mundo real, como instruções complicadas de origami ou resolver quebra-cabeças como o Cubo de Rubik. Além disso, sua capacidade de representar corretamente elementos em superfícies inclinadas ou ocultas pode ser limitada. Texturas densas ou repetitivas, como areia fina, também podem exigir atenção especial. Para garantir precisão em rótulos e diagramas que dependem da colocação exata de setas ou identificação clara de componentes, ajustes podem ser necessários.
Integração e disponibilidade
O ChatGPT Images 2.0 já está acessível para todos os usuários do ChatGPT, abrangendo os planos Free e Go. Aqueles que assinam os planos Plus e Pro têm acesso a funcionalidades mais avançadas. A OpenAI também disponibilizou essa tecnologia por meio da sua API e incorporou a geração de imagens no aplicativo Codex, que foi atualizado recentemente para incluir essa nova funcionalidade. Este lançamento ocorre poucos dias após a entrada da Anthropic no mercado de design visual com seu próprio assistente criativo.
Com informações extraídas para este artigo.
