VJOURNAL

IA • Mesa global •

Cómo escribir prompts que devuelvan un resultado útil: lo que aconsejan los creadores de los modelos

Quien busca cómo escribir prompts suele esperar una frase que desbloquee el modelo. Las guías de los propios fabricantes describen algo más sencillo: una petición completa, un ejemplo, pasos pequeños y una revisión de la respuesta.

Portada de VJOURNAL para «Cómo escribir prompts que devuelvan un resultado útil: lo que aconsejan los creadores de los modelos»

Respuesta breve

Un prompt devuelve un resultado útil cuando indica la tarea, da el contexto que el modelo no tiene, fija los límites, nombra la forma de la respuesta y dice cómo se juzgará el resultado. Añade uno o dos ejemplos, divide el trabajo largo en pasos, permite al modelo decir que no sabe y comprueba tú los datos. Es el consejo común de las guías de OpenAI, Anthropic y Google.

7 fuentes
Un prompt es la petición entera: OpenAI define el oficio como escribir instrucciones que hagan cumplir tus requisitos de forma consistente.
Las partes son cinco: la tarea, el contexto, los límites, la forma de la respuesta y el criterio con el que juzgarás el resultado.
Un ejemplo muestra lo que una descripción no alcanza; Anthropic sugiere de tres a cinco y Google recomienda incluirlos siempre.

Un prompt es la petición entera, no una frase mágica

Quien busca cómo escribir prompts suele esperar una lista de frases. Las guías de las empresas que fabrican los modelos no traen ninguna. Wikipedia define el prompt como un texto en lenguaje natural que describe y prescribe la tarea de una IA. OpenAI añade la palabra que importa: instrucciones escritas para que el modelo genere de forma consistente contenido que cumpla tus requisitos. La habilidad está en la petición completa, sin secreto alguno.

¿Por qué la misma pregunta da una buena respuesta el lunes y una floja el martes? OpenAI afirma que lo que genera un modelo no es determinista. La guía de Google para Gemini nombra el mecanismo: un ajuste, la temperatura, controla el grado de aleatoriedad al elegir cada fragmento de texto. Wikipedia añade la parte de quien escribe: según la investigación, los modelos son muy sensibles a variaciones sutiles en el formato y la estructura del prompt, así que cada hueco de la petición se rellena distinto cada vez.

Cinco partes de una petición: tarea, contexto, límites, forma, criterio de terminado

Anthropic ofrece la imagen más útil: un empleado brillante pero nuevo, que no conoce tus normas ni tus costumbres. Su regla de oro: enseña tu prompt a un colega que sepa poco de la tarea; si él se confunde, el modelo también. Las dos primeras partes son la tarea y el contexto: para quién es el texto y qué pasó antes. Google muestra el efecto con un router averiado: al pegar su guía de resolución de problemas, la respuesta deja de ser general y habla de ese aparato.

La tercera parte son los límites y la cuarta, la forma de la respuesta. Google dice que puedes indicar al modelo qué hacer y qué no hacer; su ejemplo ocupa una línea: resume este texto en una frase. También puedes pedir una tabla, una lista o un párrafo. Anthropic añade dos matices: di lo que quieres en lugar de lo que no quieres, y explica el motivo. Prohibir los puntos suspensivos funciona mejor cuando el modelo sabe que un sintetizador de voz leerá la respuesta.

La quinta parte es la que los principiantes se saltan: cómo se juzgará el resultado. El resumen de Anthropic da por hecho que, antes de afinar nada, tienes una definición clara de éxito y una manera de comprobarla. El consejo de OpenAI para sus modelos de razonamiento coincide: sé muy específico sobre tu objetivo final. Escribe el criterio en la petición: extensión, lector, datos obligatorios.

Un ejemplo dentro de la petición vale más que su descripción

Describir un tono es difícil; mostrarlo cuesta un pegado. Anthropic llama a los ejemplos una de las formas más fiables de dirigir formato, tono y estructura, y recomienda entre tres y cinco. Deben parecerse al caso real, ser variados y quedar separados de las instrucciones. Google va más lejos: recomienda incluirlos siempre y avisa de que los prompts sin ejemplos probablemente serán menos eficaces. Una tienda puede pegar dos descripciones de producto que ya venden y pedir una tercera del mismo estilo.

Los fabricantes señalan límites: Google advierte que, con demasiados ejemplos, el modelo puede empezar a sobreajustar su respuesta a ellos. OpenAI pide una gama diversa de entradas y, para sus modelos de razonamiento, sugiere probar primero sin ejemplos. Wikipedia añade un dato: lo que un modelo aprende de los ejemplos de un prompt es temporal, a diferencia del entrenamiento. En una conversación nueva la lección ya no está: guarda tus ejemplos en un archivo.

Una petición, un trabajo: la tarea larga como cadena de pasos

Una petición que reclama a la vez investigación, plan, texto y traducción suele devolver cuatro cosas mediocres. Google da el remedio en una frase: en lugar de muchas instrucciones en un prompt, crea un prompt por instrucción. Para el trabajo secuencial su guía describe una cadena en la que la salida de un prompt es la entrada del siguiente. Una oferta comercial pasa a ser cuatro pasos: la situación del cliente, la estructura, el borrador y la comparación con el encargo.

Anthropic añade una salvedad: sus modelos actuales resuelven por dentro la mayor parte del razonamiento de varios pasos, así que la cadena ya no hace falta para que el modelo piense. Sigue siendo útil cuando quieres revisar los resultados intermedios o mantener un orden fijo. El patrón más habitual allí es la autocorrección: un borrador, una revisión según tus criterios, una versión mejorada. La ganancia: un error detectado en el paso dos no viaja a los pasos tres y cuatro.

Razonar, preguntar de vuelta y permiso para decir «no lo sé»

El truco más antiguo es pedir al modelo que piense paso a paso. Wikipedia describe esa técnica, la cadena de pensamiento: el modelo resuelve un problema mediante una serie de pasos intermedios antes de la respuesta final. La guía de OpenAI para modelos de razonamiento considera innecesarias esas peticiones, y Google señala que sus modelos Gemini recientes razonan internamente. Anthropic observa que una instrucción general de pensar a fondo suele dar mejor razonamiento que una lista de pasos escrita a mano.

Lo que sigue mereciendo una línea es la comprobación final. Anthropic sugiere añadir la instrucción de verificar la respuesta con tus criterios, y afirma que eso detecta errores de forma fiable, sobre todo en código y matemáticas. También indica que uno de sus modelos recientes ya lo hace sin pedírselo: estos consejos envejecen rápido. Su página sobre reducir las respuestas inventadas empieza por algo más simple: da permiso explícito al modelo para admitir incertidumbre. Una línea como «si el informe no trae la información necesaria, dilo» cambia lo que vuelve.

Con las preguntas de vuelta ocurre lo mismo. Un empleado nuevo preguntaría antes de empezar, y OpenAI dice de sus modelos de razonamiento que a menudo hacen preguntas aclaratorias antes de lanzar conjeturas sin fundamento. A cualquier otro modelo se le pide con una línea: antes de escribir, pregúntame lo que necesites saber. Después, pregunta de qué no estaba seguro y qué ha supuesto. Nada de esto vuelve cierta la respuesta; indica por dónde empezar a comprobarla.

Corregir el borrador en vez de empezar la conversación de cero

Google lo formula como principio: la ingeniería de prompts es iterativa. La primera respuesta es un borrador. Cuando falla, no borres la conversación; di qué está mal, qué debe quedarse y qué debe traer la siguiente versión. Si no basta, Google propone tres movimientos: usar otras palabras, pasar a una tarea análoga, como convertir una clasificación abierta en pregunta de opción múltiple, o cambiar el orden del contenido del prompt.

Una petición que por fin funciona vale más que la respuesta que produjo. Guárdala con el ejemplo y el criterio que la acompañaban. OpenAI aconseja a los equipos crear pruebas que midan cómo se comporta un prompt, para vigilar el rendimiento al iterar o cuando cambia la versión del modelo. La versión individual es una nota junto a cada prompt guardado: la fecha, el modelo, una entrada y el resultado aceptado.

Lo que un prompt no arregla: datos ausentes, otra herramienta, respuesta sin revisar

La documentación de Anthropic es directa sobre el límite. Incluso los modelos de lenguaje más avanzados pueden generar a veces un texto incorrecto en los hechos o incoherente con el material recibido. Sus técnicas reducen esos errores sin eliminarlos, y la nota final es tajante: valida siempre la información crítica, sobre todo en decisiones de alto riesgo. La redacción no aporta un dato que el modelo no tiene. OpenAI describe el remedio como añadir contexto: tus propios documentos y datos ajenos al entrenamiento del modelo.

Algunas tareas piden otra herramienta, no una frase mejor. Según la guía de Google, la búsqueda debe activarse siempre que el modelo pueda necesitar datos poco conocidos o recientes, y la ejecución de código cuando tenga que hacer aritmética, contar o calcular. Un chat sin esas ayudas no sirve para el tipo de cambio de esta semana ni para una columna de sumas. Anthropic añade que no todo resultado fallido se resuelve mejor con el prompt. En derecho, impuestos o salud, la respuesta es material para un especialista, nunca la decisión.

Tu biblioteca de prompts y lo que añade un curso estructurado

Con esto hay para una semana de práctica por tu cuenta. Elige una tarea que repites: respuestas a reseñas, una descripción de producto, un informe semanal. Escribe la petición en cinco partes, añade dos ejemplos de un resultado aceptable y pruébala en tres casos reales. Corrígela y guarda la versión que aguantó. Una docena de entradas así ya es una biblioteca con tu tono, tus productos y tus criterios. Quien después de esa semana sigue preguntando cómo escribir prompts pregunta en realidad dónde ponerlos a trabajar.

Para esa pregunta sirve un curso. El curso Inteligencia Artificial de VITON13 SCHOOL enseña a trabajar con la IA de forma consciente: de plantear la tarea al prompting y la verificación, y de ahí a automatizar tus procesos y crear agentes. Sus módulos: Trabajo consciente con la IA, Prompting como ingeniería, Investigación y verificación, Automatización de procesos, Agentes de IA, Sistemas propios, Seguridad y responsabilidad. Es un curso en línea con práctica sobre la tarea de cada alumno. Estudiar por tu cuenta te da una biblioteca; un programa pone los temas en orden. La página del curso recoge las condiciones vigentes.

Lista práctica

  • Escribe la tarea en una frase: qué hay que hacer y para quién es el resultado.
  • Pega el material que el modelo no tiene: el documento, los datos del producto, la versión anterior.
  • Añade dos o tres ejemplos de un resultado aceptable y sepáralos de las instrucciones.
  • Indica el criterio de terminado en la petición: extensión, lector, datos obligatorios y forma de la respuesta.
  • Guarda cada prompt que funcionó con la fecha, el modelo y un resultado aceptado, y vuelve a probarlo tras las actualizaciones.

Preguntas frecuentes

¿Un prompt más largo da una respuesta mejor del modelo?

Por sí solo, no. Lo que ayuda es la información que faltaba: la tarea, el contexto, los límites, la forma y el criterio. OpenAI señala que sus modelos de razonamiento responden bien a instrucciones breves y claras. Alarga la petición solo con lo que el modelo no podía saber.

¿Hace falta dar al modelo un rol, como experto o editor?

Puede ayudar. La guía de Anthropic dice que fijar un rol enfoca el comportamiento y el tono del modelo, y que una sola frase ya marca la diferencia. El rol no sustituye a la tarea ni al contexto: un experto sin encargo sigue teniendo que adivinar.

¿Cuántos ejemplos debe llevar un solo prompt?

Anthropic recomienda de tres a cinco ejemplos bien elegidos; Google recomienda incluirlos siempre y avisa de que, si son demasiados, el modelo los sigue demasiado de cerca. Empieza con dos distintos entre sí, mira el resultado y añade otro solo si la forma sigue variando.

¿Por qué el mismo prompt responde distinto cada vez?

Porque en la generación interviene el azar. OpenAI describe la salida del modelo como no determinista, y la guía de Google explica que un ajuste de temperatura controla la aleatoriedad de la elección. Una petición completa estrecha el margen: cuantos menos huecos deba rellenar el modelo, más se parecerán dos respuestas.

¿Puede un buen prompt evitar que el modelo invente datos?

Reduce el riesgo y no lo elimina. Anthropic enumera como vías permitir el «no lo sé», pedir primero citas literales del texto de origen y respaldar cada afirmación con una cita. Los datos críticos siguen necesitando una comprobación con la fuente original.