LearnAI
Новинки AI · Веб-агенты · Lección 7/10
← Al catálogo
Tarea

Seguridad: dónde debe parar el agente

Proporcione límites de seguridad al agente. Devolver SÓLO JSON: {"goal":"lo que se permite hacer","allowed":"acciones que el agente realiza por sí mismo","forbidden":"lo que está estrictamente prohibido","confirm_before":"acciones solo después de mi confirmación explícita"}

Desbloquee el acceso para enviar soluciones para una revisión instantánea de la IA.
Establecer límites de seguridad
💡 Un pedazo de teoría

El agente web actúa de forma autónoma: éste es su punto fuerte y su riesgo. Puede hacer clic, ingresar datos, enviar formularios; Esto significa que, en teoría, puede pagar y enviar algo en su nombre. Mecánica de riesgo: el agente optimiza el cumplimiento del objetivo y no siente las consecuencias como una persona; para él, "hacer clic en Pagar" es simplemente el siguiente paso hacia el resultado. Por lo tanto, los límites los estableces de antemano. Regla básica: divide las acciones en tres cestas; puedes hacerlo tú mismo, nunca podrás hacerlo, sólo con mi confirmación. Truco: mantenga el dinero y los secretos fuera de su alcance; no dé acceso a datos de pago, contraseñas o códigos de SMS; Deje que el agente conduzca hasta la canasta y se detenga. La segunda técnica es el "punto de confirmación": el agente realiza cualquier acción irreversible (pago, envío de una solicitud, eliminación) sólo después de un "sí" explícito. Información privilegiada: formule las prohibiciones de manera positiva y específica: "quédese en la etapa de la canasta", y no el vago "tenga cuidado". Un error común es dar acceso al pago por conveniencia. Ahorrar un par de minutos no vale la pena correr el riesgo de escribirlo en el lugar equivocado.

¿Cómo se evalúa · aprobado? 70

  • 1JSON válido sin texto alrededor30%
  • 2Hay campos goal, allowed, forbidden, confirm_before30%
  • 3Están prohibidos los secretos y el pago, hay un punto de confirmación.40%
Tu mensajeClaude ⌄
🔒

Desbloquee el acceso para enviar soluciones para una revisión instantánea de la IA.