jueves, 29 de abril de 2010

SEMINARIO 3: BUSCADORES


¿Cómo funciona AltaVista?

AltaVista tiene un índice que está construido mandando a un crawler (o programa robot) que captura texto y lo trae de vuelta.


El crawler principal se llama Scooter. AltaVista dijo una vez que era “el Web crawler existente más rápido”. Scooter envía miles de hilos simultáneos. 24 horas al día, 7 días a la semana, Scooter y sus hilos acceden a miles de páginas al mismo tiempo, como miles de usuarios cogiendo información y copiándola para pasársela a los indexadores de forma que luego la información esté indexada. Y al mismo tiempo consiguen de cada página, cada hipervínculo que hay en ella, para ponerlo en una lista y visitarlos más tarde.


En un día típico Scooter y sus miles de hilos visitan alrededor de 10 millones de páginas. Si hay muchos hipervínculos de otras páginas a la tuya, esto incrementa tus posibilidades de ser encontrado.


La araña (crawler) de AltaVista desciende hasta tres niveles de páginas en tu sitio Web. Es importante recordar esto si tienes páginas que no pueden accederse en con tres clics desde la página principal. Tendrás que indexarlas de forma separada.
No puedes decirle a AltaVista cómo indexar tu sitio Web, esto lo hace con su araña, pero puedes ir a la página del buscador y enviar páginas específicas para darle un empujón. La araña de AltaVista visitará tu sitio Web cada mes desde la visita inicial.


Los algoritmos de ranking de AltaVista dan más valor a palabras clave que se encuentren en una etiqueta de título. También da más valor a palabras clave que están cerca de otra palabra clave, y palabras que están cerca del principio de la página.


Scooter se adhiere a las reglas de política para Web spiders que se especifican en el Standard for Robot Exclusion (SRE). Le pregunta a cada servidor qué ficheros deberían ser excluidos de ser indexados. Scooter no puede atravesar firewalls. Utiliza un algoritmo especial de espera entre peticiones sucesivas a un servidor para no afectar a los tiempos de respuesta de los otros usuarios.


En añadidura al servicio público de búsqueda de AltaVista, su empresa matriz, Digital Equipment Corporation (DEC) vende AltaVista para uso individual (descargándolo a en tu computadora, puede buscar en tu disco duro) y para intranets de empresa.




¿Qué es un Web crawler?



Un Web crawler (araña web) es un programa que hojea metódica y automáticamente la World Wide Web. Otros términos para Web crawler son ants, automatic indexers, bots y worms o Web spider, Web robot, o especialmente en la comunidad FOAF, Web scutter.
Este proceso se llama Web crawling o spidering. Muchos sitios, en particular los buscadores, utilizan spidering como una forma de proporcionar información al día.


Los Web crawlers son mayormente utilizados para crear copias de todas las páginas visitadas para más tarde procesarlas con un buscador que indexará las páginas descargadas para proporcionar los resultados de las búsquedas más rápidamente. Los crawlers también se pueden utilizar para automatizar tareas de mantenimiento en sitios Web, como chequear los enlaces o validar código HTML. También pueden usarse para reunir tipos específicos de información de páginas Web, como recoger direcciones de e-mail (normalmente para spam).


Un Web crawler es un tipo de bot, o agente software. En general, comienza con una lista de de URLs que visitar, llamadas seeds (semillas). Mientras el crawler visita estas URLs, identifica todos los hipervínculos de la página y los añade a la lista de URLs a visitar, llamada la crawler frontier. Las URLs de la crawler frontier se visitan recursivamente de acuerdo a un conjunto de políticas.


Un crawler no solo debe tener una Buena estrategia de crawling, también debe tener una arquitectura altamente optimizada.


Shkapenyuk y Suel se dieron cuenta de esto: “Mientras que es bastante fácil construir un crawler que descargue unas pocas páginas por Segundo por un corto período de tiempo, construir un sistema de alto rendimiento que pueda descargar cientos de millones de páginas durante varias semanas presenta un número de retos en diseño de sistemas, eficiencia de entrada/salida de red, y robustez y buen manejo“.


Los Web crawlers son una parte central de los buscadores, y los detalles de sus algoritmos y arquitectura se mantienen como secretos de empresa. Cuando los crawler son diseñados y publicados, normalmente hay una falta importante de detalles que previene que otros reproduzcan su trabajo. También hay preocupaciones emergentes sobre “search engine spamming”, lo cual previene a la mayor parte de buscadores de publicar sus algoritmos de ranking.




Bibliografía

What is.com Target Search
Autores: Ivy Wigmore (Editor de Contenido), Lowell Thing (Fundador)
Enlace: http://whatis.techtarget.com/definition/0,,sid9_gci212945,00.html
Última visita: 29/04/10


Wikipedia, the free encyclopedia
Enlace: http://en.wikipedia.org/wiki/Web_crawler
Última visita: 29/04/10


“Search engine robots that visit your web site”
Enlace: http://www.jafsoft.com/searchengines/webbots.html
Última visita: 29/04/10

0 comentarios:

Publicar un comentario