- 1. Lo que realmente estás entregando — por qué una llamada a un modelo parece una función y no lo es, y qué te cuesta eso.
- 2. Casos: el activo que nadie construye — todo equipo tiene un prompt, casi ninguno tiene casos. Qué es un caso y cómo tener veinte esta misma tarde.
- 3. Verdad de referencia: cuando nadie te la da — de dónde salen las respuestas correctas cuando no hay datos etiquetados, y por qué eso se decide cuando escribes la funcionalidad.
- 4. Checks: primero los deterministas, el juez al final — cómo convertir una salida en un veredicto, y la regla que más tiempo ahorra: usar un modelo para juzgar solo aquello que no puede juzgar ninguna otra cosa.
- 5. El juez — los dos ruidos, por qué tienes que medir el del juez antes de poder leer el de tu sistema, y el procedimiento que sustituye las conjeturas por un número.
- 6. La referencia — un umbral no es una referencia. El único número que anotas y con el que aceptas que te midan.
- 7. Mantenimiento — cuándo se ejecuta la suite, qué debería hacerte mirar y qué hacer la mañana en que se pone en rojo y tú no has cambiado nada.
- 8. Para equipos que construyen para otros — la misma suite haciendo dos tareas más cuando la funcionalidad con LLM es de un cliente, y la única regla que no admite excepciones.