سید مهدی طاهری، نجلا حریری و رحمت الله فتاحی در کتاب فرادادهها، موتورهای کاوش وب و میانکنشپذیری آنها، به بررسی و مطالعۀ یکی از مهمترین مسائل حوزۀ ذخیره، بازیابی اطلاعات و دانش با تأکید بر بهبود دسترسپذیری محتوای وب از طریق ابزارهای عمومی کاوش پرداختهاند.
انگیزۀ نگارش کتاب، اهمیت موضوع، مفید و کاربردی بودن محتوای اثر برای بهبود تلاشهای کشور در زمینه میانکنشپذیری ابزارهای یاد شده و توصیه اساتید هدایتکننده و داور رساله، و دیگر همکاران بوده است. مطالب کتاب به دلیل ماهیت میانرشتهای برای هر دو گروه علم اطلاعات و علم رایانه مناسب خواهد بود.
پوشش موضوعی کتاب و پرداختن عمیق و نسبتاً مفصل به موضوعات فراداده، موتورهای کاوش وب، و فرایند میانکنشپذیری آنها، قابلیت استفاده از کتاب به عنوان منبع درسی یا کمک درسی را فراهم نموده است. معرفی اثر برای واحدهای درسی سازماندهی منابع اطلاعاتی به ویژه سازماندهی رایانهای اطلاعات در مقطع کارشناسی، بازنمایی اطلاعات (نمایهسازی پیشین) به ویژه برای تبیین نمایهسازی وب یا موتورهای کاوش وب، ذخیره و بازیابی اطلاعات، ارزشیابی نظامها و خدمات اطلاعاتی، طراحی و توسعه کتابخانههای دیجیتالی در مقطع کارشناسی ارشد، واحدهای درسی نظریههای سازماندهی دانش، تحلیل متن و دانشکاوی، وب معنایی و هستیشناسی، معماری اطلاعات در مقطع دکترای علم اطلاعات و دانششناسی و نیز واحدهای درسی مشابه در علم رایانه مفید به نظر میرسد.
در حال حاضر شبکه جهانی وب بزرگترین محیط ذخیره و بازیابی اطلاعات است. دسترسی به اطلاعات این محیط نیز مانند محیطهای سنتی نیازمند سازماندهی است. با این تفاوت که حجم گسترده اطلاعات و ویژگیهای فنی وب، نظامها و ابزارهای ویژهای را برای سازماندهی محتوا میطلبد.
فراداده، پاسخ حوزه سازماندهی دانش به مسئله دسترسی به محتوای محیط وب است. ابزار دیگر، موتورهای کاوش است که اقدامی فناورانه از سوی متخصصان حوزه فناوری اطلاعات و ارتباطات برای حل این مسئله است. با توجه به این که موتورهای کاوش بر اساس فرایند نمایهسازی، اطلاعات وب را جستجوپذیر مینمایند، به حوزه سازماندهی دانش نیز مرتبط میشوند. با این تفاوت که پیشینههای فردادهای بیشتر توسط عوامل انسانی، و محتوای جستجوپذیر از طریق موتورهای کاوش بیشتر توسط عوامل ماشینی تولید میگردد. بنابراین، هر دو ابزار از طریق نظم بخشیدن و ساماندهی اطلاعات وب، دسترسی به این اطلاعات را تسریع و تسهیل میکنند.
در بخشی از فرادادهها، موتورهای کاوش وب و میانکنشپذیری آنها میخوانیم:
برخلاف بزرگسالان باسواد، رایانهها از درک ساختار یک شیء محتوایی در زبان طبیعی عاجزند و نمیتوانند به صورت خودکار واژهها را از جملات تشخیص دهند. برای یک رایانه، یک شیء محتوایی فقط رشتهای از بایتهاست. رایانهها نمیدانند که یک نویسهی فاصله واژهها را در یک شیء محتوایی از یکدیگر جدا میسازد. در عوض، انسان باید رایانه را برای شناسایی چیزی که یک واژه مشخص یا منفرد (که به عنوان یک کلمه رمزی اشاره میشود) را میسازد، برنامهریزی کند. چنین برنامه-ای، تجزیهکننده، واژهساز، یا تعیین کننده کلمات رمزی نامیده میشود. بسیاری از موتورهای کاوش، نیز دیگر نرمافزارهای زبان طبیعی، برنامههای تخصیص داده شده برای تجزیه ایجاد میکنند.
در طی فرایند تعیین کلمات رمزی، تجزیه کننده رشتههای نویسهای که واژهها و دیگر عناصر مانند نقطهگذاری که بوسیله کدهای عددی (که برخی از آنها نویسههای کنترلی غیر چاپی هستند) بازنمود میگردند را شناسایی میکند. تجزیه کننده همچنین میتواند موجودیتهایی نظیر نشانی پستهای الکترونیکی، شمارههای تلفن، و مکانیابهای جهانی منبع (URLs) را شناسایی نماید. هنگام شناسایی هر کلمه رمزی، ممکن است چندین نویسه همچون حالت کلمه رمزی (حرف بزرگ، حرف کوچک، شکل مرکب، شکل صحیح)، زبان یا رمزگذاری، طبقه واژهای (بخش گفتار، شبیه اسم یا فعل)، محل رخداد واژه در متن، شماره جمله، محل رخداد جمله، طول جمله، و شماره خط ذخیره شوند.
بله























