Cómo medimos nubi-moderation-preview (con datos sintéticos)
Primeros números de un modelo interno de moderación, sobre un set sintético, con sus límites.
Estamos probando nubi-moderation-preview, un modelo interno que revisa comentarios de pulsos. Antes de usarlo en el producto, queríamos saber qué tan bien funciona y dónde falla. Estos son los primeros números.
Qué mide
Sección titulada «Qué mide»Cuatro cosas:
- Moderación: comentarios que no deberían mostrarse tal cual.
- Sarcasmo.
- Riesgo: señales que tiene que mirar una persona.
- Falso o spam: pruebas, trolleo, texto copiado o tecleo al azar. No es un detector de mentiras.
Cómo lo medimos
Sección titulada «Cómo lo medimos»Escribimos y etiquetamos 424 comentarios en español rioplatense, mezclando registro de colegio y de trabajo. Los dividimos en 212 para ajustar el modelo y 212 que guardamos aparte para la prueba final. Comentarios parecidos quedaron siempre del mismo lado, para que la prueba no sea con casos ya vistos.
Incluimos a propósito casos difíciles: respuestas cortas pero genuinas, quejas que se repiten, chistes comunes, y mensajes de angustia que usan palabras parecidas a un troll.
Resultados (212 casos de prueba)
Sección titulada «Resultados (212 casos de prueba)»| Tarea | Precisión | Recall | F1 |
|---|---|---|---|
| Moderación | 0,956 | 0,860 | 0,905 |
| Sarcasmo | 0,628 | 0,831 | 0,715 |
| Riesgo | 1,000 | 0,931 | 0,964 |
| Falso o spam | 0,944 | 0,971 | 0,958 |
Cada comentario tardó en promedio (mediana) poco más de un segundo y costó alrededor de US$0,0002 según nuestras estimaciones.
El sarcasmo es lo más flojo: marcó como sarcásticos 29 comentarios que no lo eran.
Lo que no detectó
Sección titulada «Lo que no detectó»De 58 casos de riesgo, se le escaparon 4: una preocupación explícita por la seguridad, una amenaza inventada que el autor admitía, un caso de consumo con peligro físico, y un pedido de ayuda ambiguo. Que no haya marcado riesgo en ningún caso sano es un resultado de esta muestra, no una promesa.
Por eso, si algún día lo usamos, va a funcionar así:
- Una señal de riesgo siempre va a una persona.
- Marcar algo como spam nunca puede tapar una posible crisis.
- Nada se borra ni se oculta automáticamente por lo que diga el modelo.
Límites
Sección titulada «Límites»- Los casos y las etiquetas los generó un asistente de IA, sin revisión humana independiente ni clínica.
- El set tiene muchos más casos positivos que la vida real, así que no dice cuán seguido aparecen estas situaciones ni cómo rinde con comentarios reales.
- Con pocos casos por tarea, hasta los números buenos tienen incertidumbre.
- Antes de cualquier afirmación de seguridad haría falta una evaluación con datos reales y revisión independiente.
Vamos a publicar los próximos números cuando los tengamos, igual que estos.