Oke, mungkin yang akan saya jelaskan dalam artikel ini tidak terlalu mendalam tetapi cukup untuk memenuhi rasa penasaran sebagian orang. Bagaimana cara kerja search engine itu? Bagaimana caranya Google mencari kata tertentu di seantero jagat maya yang luas sekali ini? Lalu apa pula rahasianya kenapa hasil pencarian Google jarang salah? Nah, berikut ini sedikit informasi tentang cara kerja search engine.
Cara kerja search engine sebenarnya terbagi atas 3 proses:
1. Proses Crawling
2. Proses Indexing
3. Proses Searching
1. Proses Crawling
Search engine memiliki script (atau biasa disebut spider) yang akan mendatangi blog atau situs-situs baru. spider ini bertugas mengumpulkan informasi mengenai blog atau situs tersebut. Mulai dari link, struktur HTML, meta tag, judul, hingga konten teks. Khusus untuk konten berupa gambar, spider umumnya akan merayapinya jika pada gambar tersebut terdapat atribut alt.
Tetapi, spider tidak akan bisa "merayap" jika pada situs atau blog tersebut tidak terdapat file robots.txt. Robots.txt ini berisikan script yang akan diterjemahkan oleh spider sebagai perintah untuk mengumulkan informasi-informasi di atas. Robots.txt juga akan memudahkan spider untuk mengumpulkan data.
Tetapi tentunya tidak semua informasi bisa dirayapi oleh spider. Beberapa informasi sengaja disembunyikan oleh robots.txt untuk menghindari situs atau blog tersebut dari serangan hacker, virus, atau pihak-pihak yang tidak berkepentingan (pembajak situs, dsb).
Proses crawling ini menjadi sangat penting, karena ini proses awal blog atau situs Anda "dikenal" oleh search engine. Jika proses crawling terganggu, maka search engine tidak akan mengenali situs Anda. Pada akhirnya jika ada user yang melakukan search terhadap keyword tertentu, walaupun situs Anda kaya akan keyword tersebut, search engine tidak akan melirik situs Anda sebagai sumber hasil pencarian.
Walaupun robots.txt sudah membantu proses crawling, ada faktor-faktor lain yang mempengaruhi. Misalnya tentang template. Jika template yang Anda gunakan memiliki banyak error, rumit, atau tidak terstruktur, proses crawling juga akan terhambat atau bahkan gagal.
2. Proses Indexing
Nah, setelah situs Anda berhasi dirayapi, informasi yang dikumpulkan oleh spider akan dikumpulkan dalam database search engine tersebut. Penyimpanan ke database ini menggunakan index yang juga menyertakan alamat URLnya. Penyimpanan ini dilakukan secara berkala untuk mempercepat proses pencarian.
3. Proses Searching
Proses terakhir ini dilakukan berdasarkan perintah pengguna search engine. Ketika user melakukan search terhadap keyword tertentu, yang dilakukan search engine bukanlah menelusuri seantero internet untuk keyword tersebut, tetapi hanyalah mencarinya di database indexing yang telah dimiliki.
Search engine akan memeriksa database index dan memberikan hasil yang paling sesuai dengan keyword yang dimasukkan user. Hasil ini akan dilengkapi dengan judul situs, cuplikan isi halaman, dan URLnya.


Comments
Post a Comment