Компютърна и комуникационна техника Извличане на информация от Интернет

Web Crowler

Курсова работа PDF 14 страници 9 сваляния 17.04.2016

Технически Университет Варна
Катедра „Компютърни науки и технологии”







Курсова работа
Извличане на информация в Интернет












Изготвил: Проверил:/............................/
Теодора Цветкова гл.ас.д-р инж. В.Алексиева
СИТ, 1-ти курс, 2А-група
Фак.№ 61262153

Задача:


Да се създаде програмна система на С++, която да реализира опростенa
система за търсене в web със следната функционалност:
a. Получава съдържанието на уеб -страницата в изходен вид от уеб
сървър.
b. Извлича текстовото съдържание (мета-данни: заглавие, ключови
думи, описание; съдържание на html -документа: игнорирайки текста в
таговете за изображения) в балансирано дърво.
c. Извлича от страницата всички линкове към други страници (.htm или
.html) и създава списък с линковете.
d. Обхожда този списък, обработвайки аналогично всяка една от
страниците, като дълбочината на вложеност да не бъде повече от 10.
e. Извежда в подходящ графичен вид граф на връзките между
страниците.
f. Генерира резултат от търсене по въведена от потребителя определена
дума – извежда линковете на страниците, в които е открита (по реда на
откриване, без рейтинг).

Теория:


Web Crawler е система за изтегляне на web страници в големи обеми и има
разнообразно приложение. На първо място тези сиеми се яв яват базовия
компонент на web търсещите машини –

Преглед на първите от 14 страници.

0 коментара

Все още няма коментари. Бъдете първият, който ще коментира.

За да коментирате, трябва да сте влезли в профила си.

Влезте