golden --evaluar
Golden, medido
Golden responde preguntas sobre este sitio (está abajo a la derecha). Esta página muestra cómo se lo evalúa, qué tan bien le va y qué todavía no sabemos. Es lo mismo que hago con los sistemas de IA de mis clientes, aplicado a mí.
Última evaluación: 8 de octubre de 2026 · llama-3.1-8b-instruct-fp8 · prompt golden-v2. Datos reales, no ilustrativos.
- 94 %de lo que afirma está en la página que cita (según el juez)
- 100 %de las preguntas sobre el sitio citan la página correcta
- 100 %de las preguntas de afuera terminan en "no lo encuentro"
- 1,5 shasta la primera palabra (mediana)
Ver los datos
| Categoría | Valor | Nota |
|---|---|---|
| Responde lo que está en el sitio | 100 % | |
| Cita la página correcta | 100 % | |
| Usa citas [n] en el texto | 71 % | |
| Fidelidad a las fuentes | 94 % | según el juez |
| Respuestas 100 % fieles | 79 % | según el juez |
| Se abstiene cuando no sabe | 100 % |
Costo de cada respuesta: 27 neuronas de Workers AI (≈ USD 0,0003). Cuando Golden no encuentra la respuesta, no llama al modelo: no gasta.
Cómo se mide
- Un golden set. 24 preguntas cuya respuesta está en el sitio, cada una con la página que debería encontrar, y 8 que no tienen nada que ver (una receta de empanadas, el mundial, un intento de hacerle olvidar sus reglas). Ahí lo correcto es decir "no lo encuentro".
- La búsqueda, por separado. Encuentra la página correcta en primer lugar el 88 % de las veces, y entre las tres primeras el 100 %. Con esas mismas preguntas se eligió desde qué parecido responde y debajo de cuál se abstiene (umbral 0,4).
- Las respuestas, como las ve un visitante. Se le hace cada pregunta y se mide si cita la página correcta, si usa citas, si se abstiene cuando debe y cuánto tarda.
- Un juez. Otro modelo (gpt-oss-120b, más grande y de otra familia que el que responde, para que no se dé la razón a sí mismo) separa cada respuesta en afirmaciones y verifica una por una si están en la fuente. También marca si Golden habla como si fuera Dani o promete algo que el sitio no dice.
- Al juez también se lo controla. La comparación del juez con la revisión a mano de Dani está en curso: hasta entonces, la fidelidad es la opinión de un modelo, no un hecho.
Lo que todavía no sabemos
- 32 preguntas son pocas: alcanzan para detectar problemas grandes, no para afinar decimales.
- Las preguntas las escribió Dani. Las de los visitantes reales van a ser distintas; las que salgan mal se suman al set.
- La latencia se mide desde Buenos Aires; desde otro lugar puede cambiar.
- Un modelo chico se equivoca: por eso cita la fuente, para que puedas verificarlo vos.
Historial
Cada cambio de modelo o de prompt se evalúa con las mismas preguntas antes de publicarse.
| Fecha | Modelo | Prompt | Página correcta | Fidelidad | Abstención | 1.ª palabra |
|---|---|---|---|---|---|---|
| 8 de octubre de 2026 | llama-3.1-8b-instruct-fp8 | golden-v2 | 100 % | 94 % | 100 % | 1,5 s |
¿Tu sistema de IA tiene estos números?
Si no sabés cuánto acierta, cuánto inventa ni cuánto cuesta cada respuesta, eso es lo primero que miro en una Revisión LLMOps.