lab --listar

Lab

Demos chicas para mostrar criterio, no fuegos artificiales. Se van encendiendo de a una.

Medido

Golden, medido

El chat de este sitio, evaluado como evalúo los sistemas de mis clientes: fidelidad a las fuentes, abstención, latencia y costo, con fecha.

Qué muestra: LLMOps aplicado a mí

Ver los números →
Jugá hoy

Cazá la alucinación

Un documento, lo que “extrajo la IA” y un campo que está mal. Apostás tu confianza y al final ves tu calibración. Desafío diario, igual para todos.

Qué muestra: Rigor de evaluación, en forma de juego

Jugar el desafío de hoy →
Próximamente

Detector de humo

Pegás una promesa de marketing sobre IA y una lista de reglas marca las señales: sin métrica, sin línea de base, sin costo, “100% autónomo”.

Qué muestra: El sello “IA sin humo”

Próximamente

Golden set en vivo

Un control deslizante muestra cómo un accuracy global alto puede esconder un campo crítico que falla.

Qué muestra: Por qué medir por campo

Próximamente

Elegí tu plataforma

Cuatro preguntas que terminan en Databricks, Copilot Studio, Bedrock o “no necesitás GenAI para esto”.

Qué muestra: Criterio de arquitectura y honestidad