Postprocesamiento geométrico de espacios de embeddings para clasificación de textos con Voronoi

Johan Argenis Franco Rogel

Abstract


Este artículo estudia si una simple corrección geométrica aplicada después de la extracción de incrustaciones mejora la separabilidad de clases en la clasificación de texto. Se evalúan seis familias de incrustaciones bajo dos condiciones, original y geométricamente mejorada, utilizando tres paradigmas: clasificación de Voronoi inducida por centroide, máquinas de vectores de soporte y agrupamiento no supervisado. El estudio abarca un corpus multiclase en español, un conjunto de datos de referencia de emociones de grano fino y un conjunto de datos de referencia de noticias. Demostramos que aumentar la isotropía puede destruir sistemáticamente la estructura discriminativa en ciertos regímenes. En el corpus en español, la corrección mejora consistentemente la clasificación de Voronoi y la clasificación supervisada. En el conjunto de datos de referencia de emociones, ayuda principalmente a Voronoi mientras que SVM permanece prácticamente sin cambios. En el conjunto de datos de referencia de noticias, degrada Voronoi, SVM y el agrupamiento en todos los modelos. El artículo también contrasta estos resultados con trabajos previos basados en métodos clásicos o débilmente supervisados y argumenta que la regularización geométrica debe tratarse como una intervención dependiente del conjunto de datos en lugar de un paso de preprocesamiento universalmente válido.

Full Text: PDF (Spanish)