system-one-design
Convierte un paso de preguntar-y-extraer en preguntas tipadas — una condición cada una, nombres de opción que no llevan el veredicto, un número de vuelta — y nunca dejes que ese número detenga el trabajo por sí solo.
Conferida por quien revisó y leyó la tarjeta, no reclamada por el propio archivo. Una tarjeta que el agente destila durante una ejecución que consumió contenido no confiable nace contaminada y queda retenida para revisión antes de ser recuperada.
Cuándo viene a la mente
- extraer un sí o un no de la prosa de un modelo
- clasificar muchos elementos con un modelo
- pedir a un modelo que puntúe algo
- la respuesta de un modelo decide lo que pasa después
Evita y Comprueba es donde suele estar el valor. Haz es la sección que todo el mundo escribe.
El cuerpo de la tarjeta de arriba es una traducción. El original en inglés es lo que importa la CLI, lo que lee el agente en ejecución y lo que atestigua el hash de abajo.
Disparador
Un paso hace a un modelo una pregunta cuya respuesta es uno de pocos valores conocidos — sí o no, una de cinco etiquetas, un nivel de bajo a alto — y luego lee ese valor en la prosa que escribió. O la misma pregunta se hace a cientos de elementos. Es una decisión tipada disfrazada de chat.
Haz
- Hazla como pregunta tipada (
chimera decide,POST /api/decideo la herramientadecide):noulpara sí/no,choicepara una de un conjunto,scorepara niveles ordenados. Vuelve una probabilidad. - Una condición por pregunta. "¿Es un error y viene de la base de datos?" son dos preguntas; haz las dos y combina las respuestas en el código, donde la regla se ve.
- Da a las opciones nombres que no lleven el veredicto (nada de "yes", "safe", "pass") y pon el significado
en los criterios. Una opción comodín ("other") es adonde va la lectura insegura — dale un criterio
estrecho o déjala fuera. Haz que las primeras palabras de las opciones difieran: un modelo local lee la etiqueta por su primer token, así que
codingycoding_agentnunca se distinguen (24 de los 231 ítems públicos de JevBench quedaron sin leer así). Sobre la opción comodín, medido en 1.000 asuntos de commit: un "other" amplio absorbió el 78% de los ítems que pertenecían a una opción nombrada, y uno estrecho el 58%; dejarlo fuera elevó el F1 de las clases nombradas de 0,24 a 0,43, al precio de que los ítems realmente fuera del conjunto caigan en una opción nombrada. - Muestra al modelo solo lo que se juzga: no la salida de herramienta alrededor, no una frase que defiende una respuesta.
- Elige cualquier umbral a partir de ejemplos etiquetados, nunca de una suposición, y guarda el número junto a la decisión que alimentó.
- Deja la aritmética, las fechas y los recuentos en el código: calcula el hecho, ponlo en el estado y pregunta por él. Un modelo de decisión lee; no calcula (en el nivel difícil de JevBench el modelo local acertó 1 de 15 ítems de fechas y números).
Evita
Dejar que el número termine, salte o apruebe trabajo. Una decisión puede añadir escrutinio — una revisión, un aviso, una segunda comprobación — y nada más: la única decisión de este proyecto que podía decir "para aquí" empeoró todos los modelos que guió, y más cuanto mejor era el modelo.
Evita también leer la respuesta tras un razonamiento (el número colapsa a 0 o 1), dividir un juicio en átomos que describen algo que ambas clases comparten (un átomo "¿destruye datos?" marcó limpiezas legítimas tanto como ataques) y tratar una probabilidad cruda como calibrada. Mantén el estado ligero: una línea por cada hecho que no se disparó (una columna de "none") movió el número en todos los ítems, y el mismo contenido repetido se lee como un patrón que no existe.
Comprueba
- El linter acepta cada pregunta (una pregunta rechazada nunca llega a un modelo).
- Cada pregunta responde en ambos sentidos a lo largo de tus elementos; una que siempre dice lo mismo está leyendo el formato, no el texto.
- Con un estado largo y un modelo local, el prompt cabe en la ventana de contexto — un corte silencioso pasa por resultado del modelo.
- En algún sitio, una muestra etiquetada muestra que el número separa los casos que importan — y cubre todas las formas en que la decisión se equivoca, en ambos lados; una muestra de un solo tipo de fallo calibra solo ese tipo.
- Antes de leer un cambio de redacción como un efecto, vuelve a hacer la pregunta sin cambios y mira cuánto se mueve el número por sí solo.
Riesgo
Una respuesta tipada parece más segura que la prosa, y no lo es: un modelo pequeño puede ordenar bien y aun así equivocarse con confianza en el medio de su escala. Trata un número sin calibrar como una pista, regístralo y calibra con tus propias etiquetas antes de que un umbral signifique algo.
Cómo usarla
La tarjeta es un dato. Clona el repositorio e impórtala por ruta: lo que llega por la red se trata como contaminado y queda retenido a la espera de aprobación, que es el comportamiento deseable y la razón por la que aquí no hay un instalador de una línea.
git clone https://github.com/brcampidelli/chimera-agent.gitchimera skills-import chimera-agent/skills/system-one-design/SKILL.mdIntegridad
SHA-256 del archivo tal como se publicó. Quien lo importe puede comprobar que lo que recibió es lo que mostró esta página.
347bfae9f826835f3351a60983b826f9b59fe5a7a9c1b87bf1a7bc3415ece699