Comienza por una tarea limitada
Elige una tarea con entrada y resultado observables: clasificar, recuperar una política aprobada, preparar un borrador o llamar una herramienta controlada. Instrucciones amplias impiden evaluar y esconden decisiones de política en el prompt.
Controla conocimiento y acción por separado
La recuperación debe mostrar qué fuente apoya la respuesta y qué ocurre si falta evidencia. Las herramientas requieren autorización, validación e idempotencia propias. Una respuesta fluida nunca prueba que una acción externa tuvo éxito.
Evalúa fallos representativos
Construye conversaciones normales, ambiguas, adversas e incompletas. Mide cumplimiento, afirmaciones sin apoyo, rechazo seguro, transferencia, latencia y costo. Repite cuando cambien modelo, prompt, fuente o herramienta.
Opera con un camino humano
El usuario necesita acceso claro a una persona cuando faltan confianza o autorización. Transfiere contexto relevante sin exponer datos innecesarios. Logs, monitoreo y kill switch son requisitos operativos.