Ir al contenido

Cómo medimos nubi-moderation-preview (con datos sintéticos)

Primeros números de un modelo interno de moderación, sobre un set sintético, con sus límites.

Estamos probando nubi-moderation-preview, un modelo interno que revisa comentarios de pulsos. Antes de usarlo en el producto, queríamos saber qué tan bien funciona y dónde falla. Estos son los primeros números.

Cuatro cosas:

  • Moderación: comentarios que no deberían mostrarse tal cual.
  • Sarcasmo.
  • Riesgo: señales que tiene que mirar una persona.
  • Falso o spam: pruebas, trolleo, texto copiado o tecleo al azar. No es un detector de mentiras.

Escribimos y etiquetamos 424 comentarios en español rioplatense, mezclando registro de colegio y de trabajo. Los dividimos en 212 para ajustar el modelo y 212 que guardamos aparte para la prueba final. Comentarios parecidos quedaron siempre del mismo lado, para que la prueba no sea con casos ya vistos.

Incluimos a propósito casos difíciles: respuestas cortas pero genuinas, quejas que se repiten, chistes comunes, y mensajes de angustia que usan palabras parecidas a un troll.

Tarea Precisión Recall F1
Moderación 0,956 0,860 0,905
Sarcasmo 0,628 0,831 0,715
Riesgo 1,000 0,931 0,964
Falso o spam 0,944 0,971 0,958

Cada comentario tardó en promedio (mediana) poco más de un segundo y costó alrededor de US$0,0002 según nuestras estimaciones.

El sarcasmo es lo más flojo: marcó como sarcásticos 29 comentarios que no lo eran.

De 58 casos de riesgo, se le escaparon 4: una preocupación explícita por la seguridad, una amenaza inventada que el autor admitía, un caso de consumo con peligro físico, y un pedido de ayuda ambiguo. Que no haya marcado riesgo en ningún caso sano es un resultado de esta muestra, no una promesa.

Por eso, si algún día lo usamos, va a funcionar así:

  • Una señal de riesgo siempre va a una persona.
  • Marcar algo como spam nunca puede tapar una posible crisis.
  • Nada se borra ni se oculta automáticamente por lo que diga el modelo.
  • Los casos y las etiquetas los generó un asistente de IA, sin revisión humana independiente ni clínica.
  • El set tiene muchos más casos positivos que la vida real, así que no dice cuán seguido aparecen estas situaciones ni cómo rinde con comentarios reales.
  • Con pocos casos por tarea, hasta los números buenos tienen incertidumbre.
  • Antes de cualquier afirmación de seguridad haría falta una evaluación con datos reales y revisión independiente.

Vamos a publicar los próximos números cuando los tengamos, igual que estos.