Mostrando entradas con la etiqueta corpus. Mostrar todas las entradas
Mostrando entradas con la etiqueta corpus. Mostrar todas las entradas

domingo, 26 de marzo de 2017

petraTAG: ¿Cómo extraer los diálogos de un texto?

Tras varios meses ocupados en otros proyectos, ¡ha llegado la hora de retomar petraTAG! Tenemos previstas muchas novedades muy interesantes pero, para amenizar la espera, hemos pensado que ya era hora de lanzar una nueva versión de petraTAG, así que ya podéis descargarla desde la página web de petraTAG.

Dado que actualmente estamos desarrollando diversas nuevas características, es un momento ideal para hacernos llegar vuestras ideas y sugerencias, así que no dudéis en publicar aquí un comentario o enviarnos un mensaje directamente a la dirección de la sección de contacto de nuestra página principal.

Una de las funciones que hemos mejorado es el análisis de los diálogos. La mejor manera de ilustra esta función es mediante un ejemplo, como el siguiente texto extraído de «Los cinco y el tesoro de la isla» de Enid Blyton:

Mamá movió la cabeza.
¡Qué estupendo ponerme otra vez los shorts!dijo Ana, bailando de contenta—. Ya estoy cansada del uniforme del colegio. Tengo enormes ganas de ir con shorts o en traje de baño y ponerme a jugar con los chicos.

En el texto anterior, hemos diferenciado mediante colores el texto clasificándolo en tres tipos:
1. Texto normal (en azul)
2. Diálogos (en verde)
3. Acotaciones de diálogos (en morado)

petraTAG puede hacer un recuento de las palabras de un texto que corresponden a cada categoría. Además, extrae los interlocutores y los ordena según el número de veces que se les cita.

Para utilizar esta función, hay que cargar y etiquetar un texto, para lo que basta con elegir Archivo → Cargar archivo. El texto se importará y se etiquetará automáticamente, para lo que es necesario esperar un poco. Cuando aparezcan las estadísticas de etiquetado, hay que elegir Herramientas → Extraer diálogos y en unos segundos obtendremos los resultados. Por ejemplo, para el libro «Los cinco y el tesoro de la isla» que antes comentábamos, obtenemos lo siguiente:

Así podemos confirmar por ejemplo, con las estadísticas en la mano, que Dick era el protagonista menos relevante. También vemos que gran parte del texto son diálogos, algo habitual en la literatura juvenil. También vemos que se indica el interlocutor en la mayoría de las ocasiones.

Para compararlas, podemos ver estas estadísticas para «Crepúsculo» de Stephanie Meyer y «También esto pasará» de Milena Busquets.

Crepúsculo (Stephanie Meyer)
También esto pasará (Milena Busquets)
Conforme vamos avanzando hacia la literatura «seria», es fácil observar que el porcentaje del total que corresponde a los diálogos es cada vez menor. Curiosamente, las acotaciones aumentan en «Crepúsculo», pero disminuyen muy pronunciadamente en «También esto pasará». Por último, también salta a la vista que en estos dos últimos libros el porcentaje de casos en los que se marca el interlocutor es muy inferior. Aún más, si tenemos en cuenta que estos dos libros se han escrito en primera persona y, por tanto, el interlocutor viene implícito con el tiempo verbal (dije, grité, susurré...). De no ser así, el porcentaje sería muy inferior.

Si tenéis alguna idea sobre cómo aplicar esta función a vuestro proyecto, no dudéis en ponernos en contacto con nosotros.

domingo, 30 de agosto de 2015

petraTAG: Nueva versión con listas, por ejemplo, de rubios, morenos y calvos

Acabamos de lanzar la nueva versión de petraTAG, que puedes descargar de manera completamente gratuita desde http://www.opentranslation.es/petratag/instalacion.htm.

Esta versión incluye dos grandes novedades. La primera, ya comentada en este blog, es la posibilidad de guardar textos etiquetados, por lo que si sueles trabajar con los mismos textos, solo tendrás que etiquetarlos una vez, guardarlos y ¡ya está! Cada vez que los cargues, se cargarán también las etiquetas, por lo que no tendrás que desperdiciar el tiempo en etiquetarlos.

La segunda novedad consiste en la incorporación de una función de listas de lemas al asistente de secuencias. Por ejemplo, imagina que quieres estudiar el uso de determinados adjetivos en un texto. Antes hubieras tenido que buscar cada adjetivo y sumar manualmente los resultados, pero ahora puedes buscar de una vez todos los adjetivos que quieras y obtener automáticamente los resultados.

Pero probablemente sea verlo con un ejemplo práctico, así que vamos a ver cómo utilizan autores de diferentes países los adjetivos de color del pelo «moreno»,  «rubio» y «calvo». Nuestra tesis, un poco extravagante, es que los autores norteamericanos tienden a utilizar más el «rubio» y los latinos el «moreno».

Para ello, basta con abrir la pantalla de búsqueda, elegir la pestaña «Buscar secuencia» y hacer clic en el botón «Buscar». En el asistente que aparecerá veremos tres botones con puntos suspensivos, como vemos en la siguiente ilustración:

Estos botones permiten acceder a la pantalla de listas, donde podemos elegir la lista que nos interese. La principal utilidad de esta lista es ofrecernos un lugar cómodo donde almacenar listas, especialmente cuando sean listas que utilizamos con frecuencia o son particularmente listas. Las listas predeterminadas son las siguientes:

Para los fines de nuestro estudio, elegimos la lista «calvo,moreno,rubio» haciendo doble clic en ella. Volveremos al asistente para secuencias, donde deberemos elegir que la palabra buscada sea un nombre, de manera que quede de la siguiente manera:


¡OJO! No es necesario utilizar la pantalla de listas para indicar una lista. También podemos indicar todos los elementos que nos interesan sencillamente separándolos con una coma sin espacio. Por ejemplo, podemos escribir «calvo,moreno,rubio», «rojo,verde,azul», «alegre,contento,enfadado,triste» o lo que queramos. La pantalla de lista solo es una manera cómoda de reutilizar las listas.

¡Ya queda muy poco! Eligiendo «Aceptar» volveremos a la pantalla de búsqueda. Para que sea más fácil interpretar los resultados, elegimos que se nos muestre la distribución y que sea del lema 0 (es decir, la palabra que estamos buscando). El resultado, debe ser el siguiente:

¡Ya solo queda comenzar a cargar textos y poner a prueba nuestra tesis! Nosotros hemos encontrado lo siguiente:

Matilde Asensi - El origen perdido (5 morenos, 4 rubios, 4 calvos)
Rosa Montero - La hija del caníbal (8 morenos, 5 rubios, 4 calvos)

Stephanie Meyer - Crepúsculo (3 morenos, 11 rubios, 1 calvo)
E. L. James - Cincuenta sombras de Grey (2 morenos, 30 rubios, 0 calvos)

¡Y los resultados sorprendentemente parecen avalar nuestra tesis! ¿Pero y si hubiéramos considerado también las tonalidades pelirroja y castaña? Además, los libros que hemos elegido son bastante recientes, ¿habrá crecido o disminuido la presencia de rubios en la literatura con el tiempo? ¿Predominarán en la literatura romántica o en el terror? Ahora con petraTAG realizar cualquiera de estos estudios, o incluso uno que realmente merezca la pena, es más fácil que nunca.

Si tienes cualquier duda respecto al uso de esta función, no dudes en escribirnos y estaremos encantados de ayudarte.

sábado, 27 de septiembre de 2014

petraREV: Llegan los gráficos estadísticos

La próxima versión de petraREV incorporará gráficos estadísticos, lo que permitirá crear presentaciones visuales que resalten características interesantes.

Por el momento, estos gráficos solo están disponibles para la búsqueda de elementos, pero próximamente es probable que se incorporen en otras funciones de la aplicación.


Entre otras utilidades, estos gráficos pueden ayudar a comparar visualmente las frecuencias de palabras entre diversos conjuntos de texto, ofreciendo una interesante herramienta para estudiar y modificar el estilo de manera analítica.

domingo, 20 de julio de 2014

petraTAG: Corrección del formato de archivos TXT procedentes de PDF

Al haberse creado el formato PDF expresamente para la lectura de documentos, con frecuencia resulta incómodo cuando se intenta trabajar con el texto de un archivo PDF con una herramienta diferente de un lector, como por ejemplo petraTAG.

Aunque muchos de los lectores de archivos PDF ofrecen la posibilidad exportar el texto a un archivo de solo texto, con frecuencia el archivo resultante suele ser bastante incómodo de utilizar. Un problema muy habitual es que abundan saltos de párrafo que no  deberían existir. Es decir, muchas veces el texto se exporta como:

Linux es un operativo
pensado tanto para
funcionar en el hogar
como en el trabajo.

En lugar de:

Linux es un operativo pensado tanto para funcionar en el hogar como en el trabajo.

Podemos ver que el archivo se exporta tal como se muestra en pantalla en el PDF de origen, lo que provoca que una misma frase aparezca cortada en varios fragmentos.

Para facilitar el trabajo con este tipo de archivos, petraTAG incorpora ahora un nuevo cuadro de diálogo, al que se accede mediante el menú Archivo Preparar archivo:


En este cuadro de diálogo, podemos elegir el archivo cuyo formato queremos corregir (IMPORTANTE: Debe ser un archivo TXT exportado mediante un lector de PDF y NO un archivo en formato PDF). También podemos elegir la ruta en la que queremos guardar el archivo corregido.

Aunque hay varias opciones, por ejemplo, para quitar los números de página que también pueden ser muy molestos, normalmente basta con utilizar las opciones predeterminadas.

De esta manera, en cuestión de segundos podremos disponer de un archivo mejorado con el que podremos trabajar a nuestro gusto.