Dalam teks mining, ada learning method yang memproses teks sebagai vector (vector space model) seperti Rocchio dan kNN, ada juga yang merepresentasikan dlam skalar seperti Tree dan SVM. Dengan representasi yang berbeda, pengukuran jarak/perbedaan juga berbeda. Vektor dengan sudut dan skalar dengan jarak Ecludian.
Terlepas dari keunggulan metoda pembelajaran, representasi dokumen yang mana yang lebih baik?
Showing posts with label text mining. Show all posts
Showing posts with label text mining. Show all posts
Saturday, November 6, 2010
Friday, December 12, 2008
Tuesday, November 25, 2008
ide penelitian: menyusun "sejarah"(?)
Dari informasi2 internet (utamanya koran) kita susun secara semi otomatis suatu isi, biografi dll. Misal biografi Amien Rais. Termasuk dari koran yg diambil adalah opini.
Friday, November 21, 2008
ide riset: word clustering untuk bahasa Indonesia
Stemming merupakan salah satu bentuk word clustering
Stemming biasanya memotong sampai kata dasar.
Namun misalkan untuk kata aktif dan pasif apakah dapat dianggap sama?
Juga dalam word clustering: thesaurus.
Word clustering, bisa secara bahasa juga berdasarkan data.
Bagaimana peran word clustering untuk keperluan text categorization (juga yang lain)
Stemming biasanya memotong sampai kata dasar.
Namun misalkan untuk kata aktif dan pasif apakah dapat dianggap sama?
Juga dalam word clustering: thesaurus.
Word clustering, bisa secara bahasa juga berdasarkan data.
Bagaimana peran word clustering untuk keperluan text categorization (juga yang lain)
Monday, November 10, 2008
ide penelitian: kontras dalam teks
Ada suatu isu, apa perbedaan antara satu pihak dengan pihak lain? Misalkan kasus Bom Bali, apa perbedaan tulisan-tulisan di Koran Kompas dan Republika? Atau antara sekelompok Koran dengan sekelompok lainnya. Setelah dilihat/diuji masing-masing kelompok mempunyai kemiripan yang tinggi.
ide penelitian: kronologi
Bagaimana kronologi Pemilu AS? Bagaimana kronologi (perjalanan karir) Obama? Bagaimana kronologi peristiwa bom Bali hingga saat ini.
Jika ada sekumpulan berita seputar suatu isu, bagaimana kita membuat kronologinya?
Bagaimana sih bentuk/representasi kronologi yang mudah dibaca (dan syukur-syukur mudah dibuat) itu?
Jika ada sekumpulan berita seputar suatu isu, bagaimana kita membuat kronologinya?
Bagaimana sih bentuk/representasi kronologi yang mudah dibaca (dan syukur-syukur mudah dibuat) itu?
Ide penelitian: Siapa saja yang bernama Obama?
Dalam tayangan di TV saya lihat: saat Barack (atau Barrack?) Hussein Obama berusia sekitar 25 tahun dia “pulang kampong” ke Kenya untuk pertama kalinya dalam hidupnya. Dan dia merasa di rumah sendiri saat berada di Kenya, karena al. banyak orang yang mempunyai nama yang sama/mirip dengannya.
Siapa saja orang yang namanya sama/mirip dengannya?
Cari di search engine? Cara ini susah. Kalau kita mencari dengan Google dengan kata kunci “Obama” maka yang muncul hampir semua adalah Obama “yang itu”.
Jika ada sekumpulan artikel berita, ada bebapa nama disitu, kemudian kita diminta untuk “select distinct orang” bagaimana kita menampilkan daftar orang disitu? Kalau nama sama namun itu orang yang berbeda harus ditampilkan terpisah.
Pekerjaan terkait/mirip: WSD.
OOT: saat ini saya ketik “Obama” menggunakan MS Word, dia tandai merah (tidak dikenal), kalau kita minta saran perbaikannya adalah “Osama”! Demikian juga "Barack" disarankan "Barrack". Memang karir Obama menanjak drastis, yang beberapa tahun lalu “tidak dikenal sama sekali” sekarang menjadi presiden AS. Dan tidak terbayangkan sebelumnya ada presiden AS yang mempunyai nama ada “Hussein”nya.
Siapa saja orang yang namanya sama/mirip dengannya?
Cari di search engine? Cara ini susah. Kalau kita mencari dengan Google dengan kata kunci “Obama” maka yang muncul hampir semua adalah Obama “yang itu”.
Jika ada sekumpulan artikel berita, ada bebapa nama disitu, kemudian kita diminta untuk “select distinct orang” bagaimana kita menampilkan daftar orang disitu? Kalau nama sama namun itu orang yang berbeda harus ditampilkan terpisah.
Pekerjaan terkait/mirip: WSD.
OOT: saat ini saya ketik “Obama” menggunakan MS Word, dia tandai merah (tidak dikenal), kalau kita minta saran perbaikannya adalah “Osama”! Demikian juga "Barack" disarankan "Barrack". Memang karir Obama menanjak drastis, yang beberapa tahun lalu “tidak dikenal sama sekali” sekarang menjadi presiden AS. Dan tidak terbayangkan sebelumnya ada presiden AS yang mempunyai nama ada “Hussein”nya.
Friday, October 17, 2008
Bag of concepts pada text mining
Pada text mining ataupun juga information retrieval, biasanya dokumen teks direpresentasikan dengan "bag of term", dimana urutan atau lokasi term tidak diperhitungkan. Pada representasi ini, bobot masing-masing term dihitung secara statistik, biasanya dengan prinsip TF IDF. Umunya "term" di sini adalah "word"/kata.
Salah satu upaya untuk memperbaiki efektifitas dari text mining (atau lebih sempitnya lagi: kategorisasi dan klasterisasi) dan information retrieval adalah dengan menggunakan "bag of concept"
Terkait dengan itu, kami di IT Telkom sedang melakukan penelitian bagaimana mengimpelentasikan untuk bahasa Indoensia dan memperbaiki teknik yang ada untuk kategorisasi dokumen.
Acuan utama kami: Shady Shehata, Fakhri Karray, Mohamed Kamel: A concept-based model for enhancing text categorization. KDD 2007: 629-637
Video saat tulisan itu dipresentasikan ada di VideoLecture.
Copy - biasanya saya jalankan menggunakan Real Player
Mahasiswa yang terlibat:
*Nuri: mengimplementasikan prototipe term semantic labeller untuk bahasa Indonesia.
*Widy: mengimplementasikan Conceptual Ontohological Graph (COG) untuk bahasa Indonesia dan mencoba membuat perbaikan dari teknik semula.
*Candra: mengimplementasikan Statistical Analyzer untuk bahasa Indonesia dan mencoba membuat perbaikan dari teknik semula.
Untuk Widy dan Candra, sementara menggunakan pelabelan semantik secara manual. Kira-kira diperlukan waktu 15 menit untuk melabeli satu dokumen.
Dokumen yang akan diproses utamanya adalah untuk artikel berita bahasa Indonesia.
Salah satu upaya untuk memperbaiki efektifitas dari text mining (atau lebih sempitnya lagi: kategorisasi dan klasterisasi) dan information retrieval adalah dengan menggunakan "bag of concept"
Terkait dengan itu, kami di IT Telkom sedang melakukan penelitian bagaimana mengimpelentasikan untuk bahasa Indoensia dan memperbaiki teknik yang ada untuk kategorisasi dokumen.
Acuan utama kami: Shady Shehata, Fakhri Karray, Mohamed Kamel: A concept-based model for enhancing text categorization. KDD 2007: 629-637
Video saat tulisan itu dipresentasikan ada di VideoLecture.
Copy - biasanya saya jalankan menggunakan Real Player
Mahasiswa yang terlibat:
*Nuri: mengimplementasikan prototipe term semantic labeller untuk bahasa Indonesia.
*Widy: mengimplementasikan Conceptual Ontohological Graph (COG) untuk bahasa Indonesia dan mencoba membuat perbaikan dari teknik semula.
*Candra: mengimplementasikan Statistical Analyzer untuk bahasa Indonesia dan mencoba membuat perbaikan dari teknik semula.
Untuk Widy dan Candra, sementara menggunakan pelabelan semantik secara manual. Kira-kira diperlukan waktu 15 menit untuk melabeli satu dokumen.
Dokumen yang akan diproses utamanya adalah untuk artikel berita bahasa Indonesia.
Subscribe to:
Posts (Atom)