Mostrando entradas con la etiqueta master. Mostrar todas las entradas
Mostrando entradas con la etiqueta master. Mostrar todas las entradas

sábado, 17 de enero de 2009

Sobre WordNet y la búsqueda de contexto


He estado dándole muchas vueltas a los temas del TFM y finalmente he elegido el primero: búsqueda de contexto en resultados. Así que voy a resumiros la investigación que he hecho sobre él.

En primer lugar he estado investigando sobre WordNet en su página de la Wikipedia y me he instalado el diccionario de synsets. Además he encontrado un API para acceso desde Java (JWI) y he creado un proyecto de test en Eclipse para probar la búsqueda de sinónimos e hiperónimos.

Por otro lado, he estado buscando en la web herramientas similares a la que voy a desarrollar y he encontrado cosas curiosas como:
- BOSS: API a los resultados de búsqueda de Yahoo que te permite consultas ilimitadas al servicio. Podría ser usado para implementar la funcionalidad requerida pero habría que pensar en la experiencia de uso que queremos desde el navegador (quizá también sería útil usar Grasemonkey).
- PopGist: un buscador que utiliza BOSS y añade a los resultados de búsqueda una serie de enlaces relacionados con el concepto buscado pero en otros sitios.
-SearchPad: herramienta de pago que va conformando el contexto de una búsqueda almacenando los términos usados en ella, de forma que cuando se hayan hecho varias búsquedas sobre el mismo tema e indicado la bondad de los resultados, las resultados obtenidos serán mejores.

Finalmente no he encontrado nada similar a lo que quiere hacerse (o no he sabido buscarlo bien :P) pero tengo una idea general de cómo hacerlo.

martes, 13 de enero de 2009

jueves, 8 de enero de 2009

TFM sobre web semántica


Pues iba a ponerme a investigar un poco para el Trabajo Fin de Máster (TFM) y he pensado: "Qué mejor que contar en el blog los posibles trabajos que puedo hacer y que la gente me aconseje"; y a eso me dispongo :)

Me propusieron cuatro posibles trabajos sobre web semántica de los cuales rechacé uno porque me parecía un infierno y ahora tengo que investigar sobre los otros tres para decidir cuál haré finalmente. Los trabajos son:

1. Buscador de contexto en resultados de búsqueda. En los resultados de búsqueda de un buscador (i.e. Google) localizar la parte del documento que más tiene que ver con los criterios de búsqueda para acceder a ella directamente. Se aconseja usar un diccionario de sinónimos en inglés como WordNet.

2. Filtro de correo. Filtrar los mensajes de correo según distintos criterios (i.e. tema) sin necesidad de crear filtros por parte del usuario. Por ejemplo, pueden utilizarse criterios como el asunto, contexto del cuerpo del mensaje, destinatarios, etc... Se utilizarán herramientas como GATE y el resultado podría ser una extensión de un cliente de correo (i.e. Thunderbird).

3. Optimización del ranking en búsquedas por palabra clave. Apache Lucene utiliza el criterio TFxIDF para "rankear" los resultados de una búsqueda por palabra clave (keyword). Se propone descargar una copia de la Wikipedia a local y añadir anotaciones que nos permitan mejorar el ranking de los resultados respecto al rankeo de Lucene. Por ejemplo, hay que testear si es mejor tener en cuanta los enlaces del artículo de la Wikipedia o el tema, etc...

Bueno mientras investigo qué puede ser factible hacer para septiembre'09, ¿qué os parece a vosotros?