Analiza el mensaje de Marina. Devuelve JSON {"sees":[...],"leaked":[...],"safe_rewrite":"..."}: sees: lo que el modelo realmente ve en el mensaje; leaked - qué datos confidenciales la persona reveló accidentalmente; safe_rewrite - la misma solicitud, reescrita de forma segura (con marcadores de posición o generalización), pero preservando la esencia de la tarea. Devuelve solo JSON, sin texto alrededor.
Cuando envía una solicitud, el modelo recibe TODO el texto en su totalidad, como una única entrada, sin dividirlo en "importante" y "antecedentes". Ella no distingue su pregunta de los datos insertados al azar: nombre, número de teléfono, número de pedido, correspondencia; para ella es el mismo material. Analogía: le dictas una carta a un secretario; él escribirá cada palabra, incluso lo que murmuras en voz baja. La mecánica es más sencilla de lo que parece: no hay ningún texto “invisible”. Incluso una imagen o captura de pantalla es legible: el modelo reconoce el texto de la imagen, ve firmas y cantidades. Insider: los datos reales en el "ejemplo de contexto" se filtran de la misma manera que en la pregunta principal: la frase "esto es solo un ejemplo" no protege nada. Segundo truco: antes de enviarlo, vuelve a leer el mensaje a través de los ojos de un extraño, lo que NO quieras mostrarle a tu vecino. Un error típico de principiante: copiar toda la correspondencia o el documento completo “para que la IA pueda descifrarlo”, aunque la tarea requiere dos líneas.