Ir al contenido

Los modelos Nubi preview

Dos modelos internos que estamos probando para leer comentarios de pulsos, qué hace cada uno y en qué estado está. Ninguno está activo en Moodinary.

Nubi es el nombre que usamos para los modelos internos que leen los comentarios de los pulsos. Hoy hay dos en preview: nubi-moderation-preview, que clasifica comentarios, y nubi-entity-preview, que busca datos personales para taparlos.

Cuatro cosas en cada comentario:

  • Moderación: comentarios que no deberían mostrarse tal cual.
  • Sarcasmo.
  • Riesgo: señales que tiene que mirar una persona.
  • Falso o spam: pruebas, trolleo, texto copiado o tecleo al azar. No es un detector de mentiras.

No es un solo modelo. Combina tres piezas: una búsqueda de ejemplos parecidos ya etiquetados, un modelo que ordena esos ejemplos por relevancia, y un modelo de lenguaje que lee el comentario y responde preguntas concretas sobre cada tarea. Las tres opiniones se juntan en un puntaje por tarea, y los umbrales se eligieron solo con los casos de desarrollo, antes de mirar la prueba final.

Lo corrimos una vez con los modelos reales sobre 424 comentarios sintéticos en español rioplatense: 212 para ajustar y 212 guardados aparte como prueba final, que no se tocaron hasta el final. Los comentarios y sus etiquetas los escribió un asistente de IA, sin revisión humana independiente.

Tarea F1 en los 212 de prueba
Moderación 0,905
Sarcasmo 0,715
Riesgo 0,964
Falso o spam 0,958

Para entender si combinar piezas sirve, comparamos contra cada pieza usada sola, sobre el mismo set. Son comparaciones internas, no contra otros sistemas del mercado. La combinación no gana en todo: la búsqueda de ejemplos parecidos sola saca mejor sarcasmo (0,797 contra 0,715) y queda casi igual en moderación (0,896 contra 0,905).

Con estos datos no podemos decir que sea mejor que otras herramientas ni cómo rinde con comentarios reales. El detalle completo, con los casos de riesgo que se le escaparon, está en Cómo medimos nubi-moderation-preview.

Busca datos que identifican a alguien dentro de un comentario: nombres de personas, mails, teléfonos, direcciones, usuarios de redes y números de documento o legajo. Marca cada uno con su posición y su tipo para poder taparlo sin tocar el resto. “La profe Laura nos grita” pasaría a mostrarse con el nombre tapado.

Está construido sobre LACE, nuestra arquitectura para que varios modelos se revisen entre sí. Dos modelos marcan los datos por separado. Si coinciden, se acepta. Si no, cada uno revisa las dos listas a ciegas y hay una sola ronda para reconciliar. Ante la duda se oculta, y todo lo que cualquiera de los dos marcó queda tapado.

Eso quiere decir que a veces va a tapar palabras que no hacía falta. Y si ninguno de los dos marca un dato, la revisión no lo va a encontrar.

Solo corrió en pruebas locales con modelos simulados y casos armados a mano, que verifican que la lógica haga lo que tiene que hacer. Todavía no lo corrimos con modelos reales, así que no hay números de precisión. Cuando los tengamos, los publicamos acá.

  • No reemplazan el filtro actual. Hoy los comentarios pasan por un filtro automático con tres niveles que elige cada organización (Permisivo, Cauteloso o Estricto). No hay personas leyendo comentarios para moderarlos.
  • No deciden solos sobre riesgo. Si algún día se usan, una señal de riesgo siempre va a una persona, y marcar algo como spam nunca puede tapar una posible crisis.