Lección 8 de 10 22 min

GPT-4o multimodal: prompts con imágenes, PDFs y archivos

GPT-4o multimodal: prompts con imágenes, PDFs y archivos

GPT-4o es el primer modelo de OpenAI genuinamente multimodal: puede ver imágenes, leer documentos y procesar datos de forma nativa, en la misma conversación. Esta capacidad abre posibilidades que la mayoría de usuarios no explora.

Análisis de imágenes

Arrastra cualquier imagen a la interfaz de ChatGPT o adjúntala por la API. GPT-4o puede describirla, analizarla, extraer texto, identificar problemas o basar en ella cualquier tarea.

Review de diseño UI/UX:
"Analiza esta captura de pantalla de mi aplicación como si fueras un experto en UX. Identifica: (1) problemas de usabilidad con impacto en conversión, (2) jerarquía visual deficiente, (3) elementos que generan confusión al usuario, (4) 3 mejoras de alta prioridad. Sé específico con qué elementos y por qué."
Extracción de datos de imagen:
"Extrae todo el texto visible en esta imagen (recibo/factura/tabla/captura de pantalla) y organízalo en un JSON estructurado. Si hay una tabla, conviértela en un array de objetos. Preserva todos los valores numéricos exactamente como aparecen."

Trabajo con PDFs y documentos

Resumen ejecutivo:
"Resume este informe/documento en formato ejecutivo. Estructura: (1) De qué trata y por qué importa (2 oraciones), (2) Los 5 hallazgos o puntos más importantes con bullet points, (3) Recomendaciones o próximos pasos si los hay, (4) Lo que me sorprendió o consideraría relevante destacar. Máximo 400 palabras."
Preguntas sobre el documento:
Una vez adjuntado el PDF, puedes hacer preguntas directas:
"¿En qué página se menciona [tema]?"
"¿Qué dice el documento sobre [aspecto específico]?"
"Compara lo que dice sobre [A] con lo que dice sobre [B]"
"¿Hay contradicciones en el argumento del autor?"

Análisis de código desde imagen

"Aquí tienes una captura de pantalla de un error en mi código. Identifica qué tipo de error es, en qué línea ocurre, por qué ocurre y cómo solucionarlo. Si puedes inferir el lenguaje y contexto desde la imagen, hazlo."

Comparación de diseños o documentos

"Aquí tienes dos versiones [de diseño/documento/interfaz]. Compáralas en términos de: claridad del mensaje, experiencia de usuario/lectura, y objetivo que persigue cada una. Indica cuál recomendarías para [contexto] y por qué, con argumentos específicos."

📝 Comprueba lo aprendido

Responde estas 3 preguntas y acierta al menos el 60% para desbloquear el botón "Marcar como completada".

1 ¿Qué significa que GPT-4o sea "multimodal"?

2 ¿Cuál es el mejor uso de GPT-4o con imágenes para un desarrollador?

3 ¿Qué ventaja tiene pedir la salida de análisis de documentos en JSON?

Cuando termines, guarda tu avance. Así podrás continuar desde tu panel y desbloquear el certificado al completar el curso.