GPT-4o multimodal: prompts con imágenes, PDFs y archivos
GPT-4o multimodal: prompts con imágenes, PDFs y archivos
GPT-4o es el primer modelo de OpenAI genuinamente multimodal: puede ver imágenes, leer documentos y procesar datos de forma nativa, en la misma conversación. Esta capacidad abre posibilidades que la mayoría de usuarios no explora.
Análisis de imágenes
Arrastra cualquier imagen a la interfaz de ChatGPT o adjúntala por la API. GPT-4o puede describirla, analizarla, extraer texto, identificar problemas o basar en ella cualquier tarea.
"Analiza esta captura de pantalla de mi aplicación como si fueras un experto en UX. Identifica: (1) problemas de usabilidad con impacto en conversión, (2) jerarquía visual deficiente, (3) elementos que generan confusión al usuario, (4) 3 mejoras de alta prioridad. Sé específico con qué elementos y por qué."
"Extrae todo el texto visible en esta imagen (recibo/factura/tabla/captura de pantalla) y organízalo en un JSON estructurado. Si hay una tabla, conviértela en un array de objetos. Preserva todos los valores numéricos exactamente como aparecen."
Trabajo con PDFs y documentos
"Resume este informe/documento en formato ejecutivo. Estructura: (1) De qué trata y por qué importa (2 oraciones), (2) Los 5 hallazgos o puntos más importantes con bullet points, (3) Recomendaciones o próximos pasos si los hay, (4) Lo que me sorprendió o consideraría relevante destacar. Máximo 400 palabras."
Una vez adjuntado el PDF, puedes hacer preguntas directas:
"¿En qué página se menciona [tema]?"
"¿Qué dice el documento sobre [aspecto específico]?"
"Compara lo que dice sobre [A] con lo que dice sobre [B]"
"¿Hay contradicciones en el argumento del autor?"
Análisis de código desde imagen
Comparación de diseños o documentos
📝 Comprueba lo aprendido
Responde estas 3 preguntas y acierta al menos el 60% para desbloquear el botón "Marcar como completada".