Showing posts with label text mining. Show all posts
Showing posts with label text mining. Show all posts

Saturday, November 6, 2010

Text: direpresentasikan vector atau skalar?

Dalam teks mining, ada learning method yang memproses teks sebagai vector (vector space model) seperti Rocchio dan kNN, ada juga yang merepresentasikan dlam skalar seperti Tree dan SVM. Dengan representasi yang berbeda, pengukuran jarak/perbedaan juga berbeda. Vektor dengan sudut dan skalar dengan jarak Ecludian.

Terlepas dari keunggulan metoda pembelajaran, representasi dokumen yang  mana yang lebih baik?

Friday, December 12, 2008

BNC, ANC

British National Corpus (BNC) dan American National Corpus (ANC)

Indonesian?
Melayu?

Tuesday, November 25, 2008

ide penelitian: menyusun "sejarah"(?)

Dari informasi2 internet (utamanya koran) kita susun secara semi otomatis suatu isi, biografi dll. Misal biografi Amien Rais. Termasuk dari koran yg diambil adalah opini.

Friday, November 21, 2008

ide riset: word clustering untuk bahasa Indonesia

Stemming merupakan salah satu bentuk word clustering

Stemming biasanya memotong sampai kata dasar.

Namun misalkan untuk kata aktif dan pasif apakah dapat dianggap sama?

Juga dalam word clustering: thesaurus.

Word clustering, bisa secara bahasa juga berdasarkan data.



Bagaimana peran word clustering untuk keperluan text categorization (juga yang lain)

Monday, November 10, 2008

ide penelitian: kontras dalam teks

Ada suatu isu, apa perbedaan antara satu pihak dengan pihak lain? Misalkan kasus Bom Bali, apa perbedaan tulisan-tulisan di Koran Kompas dan Republika? Atau antara sekelompok Koran dengan sekelompok lainnya. Setelah dilihat/diuji masing-masing kelompok mempunyai kemiripan yang tinggi.

ide penelitian: kronologi

Bagaimana kronologi Pemilu AS? Bagaimana kronologi (perjalanan karir) Obama? Bagaimana kronologi peristiwa bom Bali hingga saat ini.

Jika ada sekumpulan berita seputar suatu isu, bagaimana kita membuat kronologinya?
Bagaimana sih bentuk/representasi kronologi yang mudah dibaca (dan syukur-syukur mudah dibuat) itu?

Ide penelitian: Siapa saja yang bernama Obama?

Dalam tayangan di TV saya lihat: saat Barack (atau Barrack?) Hussein Obama berusia sekitar 25 tahun dia “pulang kampong” ke Kenya untuk pertama kalinya dalam hidupnya. Dan dia merasa di rumah sendiri saat berada di Kenya, karena al. banyak orang yang mempunyai nama yang sama/mirip dengannya.

Siapa saja orang yang namanya sama/mirip dengannya?

Cari di search engine? Cara ini susah. Kalau kita mencari dengan Google dengan kata kunci “Obama” maka yang muncul hampir semua adalah Obama “yang itu”.

Jika ada sekumpulan artikel berita, ada bebapa nama disitu, kemudian kita diminta untuk “select distinct orang” bagaimana kita menampilkan daftar orang disitu? Kalau nama sama namun itu orang yang berbeda harus ditampilkan terpisah.
Pekerjaan terkait/mirip: WSD.

OOT: saat ini saya ketik “Obama” menggunakan MS Word, dia tandai merah (tidak dikenal), kalau kita minta saran perbaikannya adalah “Osama”! Demikian juga "Barack" disarankan "Barrack". Memang karir Obama menanjak drastis, yang beberapa tahun lalu “tidak dikenal sama sekali” sekarang menjadi presiden AS. Dan tidak terbayangkan sebelumnya ada presiden AS yang mempunyai nama ada “Hussein”nya.

Friday, October 17, 2008

Bag of concepts pada text mining

Pada text mining ataupun juga information retrieval, biasanya dokumen teks direpresentasikan dengan "bag of term", dimana urutan atau lokasi term tidak diperhitungkan. Pada representasi ini, bobot masing-masing term dihitung secara statistik, biasanya dengan prinsip TF IDF. Umunya "term" di sini adalah "word"/kata.

Salah satu upaya untuk memperbaiki efektifitas dari text mining (atau lebih sempitnya lagi: kategorisasi dan klasterisasi) dan information retrieval adalah dengan menggunakan "bag of concept"

Terkait dengan itu, kami di IT Telkom sedang melakukan penelitian bagaimana mengimpelentasikan untuk bahasa Indoensia dan memperbaiki teknik yang ada untuk kategorisasi dokumen.

Acuan utama kami: Shady Shehata, Fakhri Karray, Mohamed Kamel: A concept-based model for enhancing text categorization. KDD 2007: 629-637

Video saat tulisan itu dipresentasikan ada di VideoLecture.
Copy - biasanya saya jalankan menggunakan Real Player

Mahasiswa yang terlibat:
*Nuri: mengimplementasikan prototipe term semantic labeller untuk bahasa Indonesia.
*Widy: mengimplementasikan Conceptual Ontohological Graph (COG) untuk bahasa Indonesia dan mencoba membuat perbaikan dari teknik semula.
*Candra: mengimplementasikan Statistical Analyzer untuk bahasa Indonesia dan mencoba membuat perbaikan dari teknik semula.

Untuk Widy dan Candra, sementara menggunakan pelabelan semantik secara manual. Kira-kira diperlukan waktu 15 menit untuk melabeli satu dokumen.

Dokumen yang akan diproses utamanya adalah untuk artikel berita bahasa Indonesia.