ระบบให้คำอธิบายเชิงความหมายแบบกึ่งอัตโนมัติสำหรับข้อมูลด้านศิลปวัฒนธรรมและภูมิปัญญาท้องถิ่น
ชื่อผู้แต่งข้างต้นเป็นข้อความจากระเบียนผลงาน ไม่ได้ผูกกับรหัสนักวิจัย จึงกดดูผลงานอื่นของบุคคลนี้ไม่ได้ — ในคลังนี้ 142,080 ผลงาน (63.6% ของทั้งหมด) มีชื่อผู้แต่งที่เชื่อมกับหน้าผู้แต่งได้ และ 60,298 ผลงาน (27.0%) มีผู้แต่งที่ผูกกับรหัสนักวิจัยจริง ส่วนอีก 81,382 ผลงานไม่มีข้อมูลผู้แต่งเลย (มีชื่อผู้แต่งเป็นข้อความอยู่ 142,009 ผลงาน = 63.5%)
บทคัดย่อ
งานวิจัยนี้มีจุดประสงค์หลักเพื่อพัฒนาระบบให้คำอธิบายเชิงความหมายแบบกึ่งอัตโนมัติ สำหรับให้คำอธิบายข้อมูลด้านศิลปวัฒนธรรมและภูมิปัญญาท้องถิ่นกรณีศึกษาจังหวัดพัทลุง โดยงาน ในปีที่สองนี้จะมุ่งเน้นในการวิเคราะห์เทคโนโลยีและพัฒนาคอมโพเนนท์ตามสถาปัตยกรรมระบบ การดำเนินการพัฒนาระบบมีดังนี้ (1) คอมโพเนนท์ตัดคำและแยกประโยคจะใช้เทคนิคใช้ เครื่องมือตัดคำหลักคือ LongLexto ประกอบกับพจนานุกรมด้านศิลปวัฒนธรรมภาคใต้ ในส่วนการ แบ่งแยกประโยคจะใช้เทคนิควิธีการแบ่งหน่วยประโยคตามการปรากฏของนิพจน์ระบุขอบเขต (Discourse Segment Cues) (2) คอมโพเนนท์รู้จำประเภทของนิพจน์ใช้เทคนิคร่วมประกอบด้วย วิธีการกำหนดรูปแบบการรู้จำ (Pre defined Pattern)วิธีการเทียบนิพจน์กับออนโทโลยีเอนทีตื้ (Ontology Entity Mapping)และคำอธิบายในพจนานุกรม และการใช้ข้อมูลจากลิงค์โอเพนดาต้า นอกจากนี้ยังอาศัยอัลกอริทีมการจำแนกมาช่วยลดความกำกวมของการระบุนิพจน์ (3) คอมโพเนนท์ การสร้างข้อมูล RDF จะใช้เครื่องมือ Jena AP ในการแปลงนิพจน์และความสัมพันธ์ที่สกัดได้ให้อยู่ใน ผลจากการประเมินประสิทธิผลการทำงานระบบให้คำอธิบายในระดับอัตโนมัติ พบว่าระบบ สามารถระบุนามนิพจน์ที่สอดคล้องกับคลาสในออนโทโลยีพบว่าค่าเฉลี่ย precision มีค่า 83.66% ส่วน ค่าเฉลี่ย recall เท่ากับ 74.34% หมายความว่าโปรแกรมสามารถระบุนามนิพจน์ได้แมนยำในระดับดี และครอบคลุมครบถ้วนในระดับปานกลาง ส่วนการสกัดความสัมพันธ์ระหว่างนิพจน์ก่อนทำความ สะอาดรูปประโยคประสิทธิผลอยู่ในระดับอัตนมัติต่ำ แต่หากมีการทำความสะอาดจะประสิทธิผลของ การสกัดอยู่ในระดับปานกลาง จากการทดลองผู้วิจัยพบว่าการให้คำอธิบายแบบอัตโนมัติเพื่อหา ความสัมพันธ์ระหว่างนิพจน์จะมีข้อจำกัดในเรื่องภาษาธรรมชาติค่อนข้างสูง จะเห็นว่าการให้คำอธิบาย แบบ semi-automation จะเปิดโอกาสให้ผู้ใช้เข้ามามีส่วนร่วมในการให้คำอธิบายความสัมพันธ์เปรียบเสมือนกระบวนการทำความสะอาดข้อมูล ซึ่งก็จะทำให้การให้คำอธิบายครอบคลุมและถูกต้อง กว่าการสกัดอย่างอัตโนมัติโดยระบบ