کتاب مجموعه مقالات سومین همایش ملی زبان شناسی پیکرهای به قلم آزاده میرزائی، به تحلیل زبانشناسی پیکرهای و بررسی کارکردهای پیکره در زبان فارسی میپردازد.
زبانشناسی پیکرهای حوزۀ نو پایی است که به واسطهی ورود رایانه و اینترنت به سرعت در حال پیشرفت است تا حدی که جای خود را در میان حوزههای دیگر زبانشناسی باز کرده است.
کارآمدی پیکرهها در پژوهشهای نظری و کاربردی مرتبط با زبان، باعث شده ساخت پیکرهها از یک طرف و روشها و رویکردها در بهرهبرداری از پیکرهها با اهداف پژوهشی متنوع، توجه پژوهشگران حوزههای مختلف را به خود جلب کند.
امروزه زبانشناسی پیکرهای چه در مقام ابزاری پژوهشی که بررسی پدیدهها و نظریات مطرح در زبان را مورد هدف قرار داده و چه در جایگاهی که صدور فرضیات و نظریات زبانی را رقم میزند، جزئی جدایی ناپذیر از پژوهشهای زبانی است. در ارتباط با زبان فارسی در حال حاضر دستاوردهای ارزندهای هم به لحاظ کمی و سرعت پیشرفت محتوا و هم از جهت تعداد، در دست است. مجموعه مقالات در همایش پیشین زبانشناسی پیکرهای و مجموعه حاضر شاهدی بر این مدعا هستند.
امید است مجموعه حاضر که دربرگیرنده وجود مختلفی از مطالعات زبانشناسی پیکرهای در موضوعات فرایندهای شکلگیری برخی پیکرههای برچسب خورده و نخورده، پردازش زبان طبیعی با استفاده از پیکرههای زبانی، کاربرد پیکره در آموزش زبان، تحلیل گفتمان و استخراج روالها، الگوها و قواعد زبان فارسی بر اساس پیکرهای موجود است، به بالندگی این حوزه مطالعاتی کمک خواهد کرد.
در بخشی از کتاب مجموعه مقالات سومین همایش ملی زبان شناسی پیکرهای میخوانیم:
فاز اول طراحی سامانه بازشناسی خودکار مکالمات خلبان و واحدهای مراقبت پرواز که در پژوهشهای آتی تهیه خواهد شد، به تهیه دادههای هوانوردی (شامل دادگانهای گفتاری و متنی) اختصاص داشت که در این پژوهش به آن پرداختیم. جمعآوری داده گفتاری و برچسب زنی آن یکی از چالشهای این مرحله از پژوهش بود. دادههای صوتی به راحتی در دسترس نبودند و معادلهای متنی برای آنها وجود نداشت (یا اگر وجود داشت بسیار نامنظم بود).
با تلاش فراوان و پس از مذاکرات طولانی با واحدهای مراقبت پرواز توانستیم دو دسته از دادههای صوتی مربوط به مکالمات خلبان و برج مراقبت را به دست بیاوریم. این دادهها مخلوطی از مکالمات انگلیسی و فارسی و با فرمتهای مختلف صوتی بودند که در مرحله اول، فرمتها را یکسان سازی کرده و تمام دادهها را از لحاظ نرخ نمونه برداری یکدست کردیم و همین طور مکالمات غیر انگلیسی را از بین آنها حذف نمودیم.
در مرحله بعد چالش برچسب زنی متنی دادههای صوتی را در پیش رو داشتیم. مکالمات به شدت نویژی و غیر قابل فهم بودند و لازم بود برای پیاده سازی آنها به صورت متنی از افراد متخصص و خبره در زمینه هوانوردی کمک بگیریم. متن نوشته شده توسط این افراد، از بعضی لحاظ برای آموزش مدلهای صوتی (آکوستیک) بازشناسی گفتار مناسب نبود. مثلا اعداد و اختصارات هوانوردی باید به شکل تلفظ شده شان نوشته میشد و... که در نتیجه لازم بود تمام متون مورد بازبینی و ویرایش قرار گیرند و از لحاظ املایی یکدست شوند. در انتهای این فرایند حدود 152 دقیقه داده صوتی تقطیع شده به همراه معادل متنی آنها را در اختیار داشتیم.
بله

















