Bot gromadzi dane dla Wikipedii

Anna Wasilewska-Śpioch 11-07-2008, 17:16

Bez względu na rzeczywistą jakość haseł w Wikipedii dość często bywa ona postrzegana jako niezbyt wiarygodne źródło informacji. Dobrym pomysłem wydaje się zaangażowanie do pracy nad nią środowiska naukowego. A gdyby tak stworzyć bota, który pobierałby informacje z renomowanych baz danych i przetwarzał je do formatu Wikipedii? Ideę tę z powodzeniem realizują genetycy.

Naukowcy skupieni wokół Genomics Institute of the Novartis Research Foundation zabrali się do uzupełniania Wikipedii o artykuły związane z genetyką. Co ciekawe, ich praca jest w pełni zautomatyzowana, inicjatorzy projektu wykorzystują bowiem udostępniony na licencji Apache 2.0 skrypt protein-box-bot.

Narzędzie zostało zaprojektowane do pobierania rekordów z internetowych baz danych, takich jak Entrez Gene. O zdobyte w ten sposób informacje tekstowe i wykresy (w galerii można zobaczyć przykład) w pierwszej kolejności wzbogacono 650 artykułów, opublikowanych w Wikipedii wcześniej. Powstało też 7,5 tys. zalążków haseł, które przydałoby się jeszcze rozbudować.

Jedną z ważnych funkcjonalności bota jest uzupełnianie artykułów o dane bibliograficzne (odsyłacze do fachowych publikacji, w których wspomina się interesujący nas gen). W tym zakresie skrypt wymaga dopracowania - uważa John Timmer z serwisu Ars Technica, który sprawdził, dokąd prowadzą poszczególne linki pod jednym z haseł. Jego zdaniem, tylko jedna trzecia z podanych w bibliografii tekstów zawierała istotne informacje o danym genie.

fot. Wikipedia - Dane zebrane za pomocą skryptu protein-box-bot

W opublikowanym na łamach PLoS Biology dokumencie twórcy projektu przyznali się, że początkowo chcieli nawiązać współpracę z konkurencyjnym dla Wikipedii serwisem Citizendium, stworzonym przez Larry'ego Sangera, współzałożyciela "wolnej encyklopedii". Citizendium, wciąż jeszcze oznaczone jako wersja beta, od pierwowzoru różni się tym, że wszyscy autorzy muszą podawać podczas rejestracji prawdziwe dane, artykuły zaś opracowywane są pod czujnym okiem ekspertów.

O przewadze Wikipedii zadecydowała jej większa popularność - inicjatorzy projektu chcieliby zainteresować genetyką jak najwięcej osób, również ze środowiska naukowego. Okazało się też, że próbując odszukać konkretną informację za pomocą Google, w 60% przypadków na pierwszej stronie wyników wyszukiwania znajdziemy umieszczone w Wikipedii zalążki artykułów, stworzone za pomocą protein-box-bota.

Więcej w tym temacie:

Następny artykuł » zamknij

Źródło: Ars Technica, PLoS Biology

Ostatnie artykuły:

fot. Freepik Google schowa nasz numer IP. Mniej niechcianych reklam czy tylko kasowanie konkurencji?	fot. materiały prasowe Polacy przed majówką mogą w sklepach przeżyć lekki szok	fot. rawpixel.com Polskie zespoły obsługi klienta poświęcają tylko 35 proc. czasu na ich obsługę
fot. AI Chamber AI Chamber, czyli polska Izba AI już działa. Nowa instytucja ma pobudzić rozwój ekosystemu sztucznej inteligencji w Polsce i CEE	fot. materiały prasowe Helios - nowy najpotężniejszy superkomputer w Polsce	Gotowy na Code Europe - największy festiwal technologiczny w Polsce?

Tematy pokrewne:

Wikipedia

naukowcy

genetyka

bot

« strona główna - do góry ^

Stopka

Publikacje

Nasze serwisy

Kanały dostępu

Polecamy