Fornire all'agente limiti di sicurezza. Restituisce SOLO JSON: {"goal":"cosa è consentito fare","allowed":"azioni che l'agente esegue da solo","forbidden":"cosa è severamente vietato","confirm_before":"azioni solo dopo la mia esplicita conferma"}
L'agente web agisce in modo autonomo: questa è la sua forza e il suo rischio. Può cliccare, inserire dati, inviare moduli; Ciò significa che, in teoria, può pagare e inviare qualcosa per tuo conto. Meccanica del rischio: l'agente ottimizza il raggiungimento dell'obiettivo e non ne avverte le conseguenze come una persona: per lui “fare clic su Paga” è semplicemente il passo successivo verso il risultato. Pertanto, stabilisci i confini in anticipo. Regola di base: dividi le azioni in tre cestini: puoi farlo da solo, non potrai mai farlo, solo con la mia conferma. Trucco: tieni soldi e segreti fuori dalla portata - non dare accesso a dati di pagamento, password, codici da SMS; lascia che l'agente si avvicini al cestino e si fermi. La seconda tecnica è il “punto di conferma”: l'agente compie qualsiasi azione irreversibile (pagamento, invio di una richiesta, cancellazione) solo dopo un esplicito “sì”. Insider: formulare i divieti in modo positivo e specifico: "rimanere nella fase del paniere", e non il vago "stai attento". Un errore comune è consentire l’accesso al pagamento per motivi di comodità. Risparmiare un paio di minuti non vale il rischio di scriverlo nel posto sbagliato.
Sblocca l'accesso per inviare soluzioni per la revisione istantanea dell'intelligenza artificiale.