Quá trình phânloại vănbản

Một phần của tài liệu Ứng dụng giải thuật di truyền vào phân loại tài liệu dạng văn bản (Trang 50 - 52)

Quá trình phân loại văn bản bao gồm các bƣớc:

Bước 1: Đánh chỉ số

Ở bƣớc này, dữ liệu đầu vào sẽ là một văn bản và kết quả đầu ra là một chuỗi các chỉ số thuật ngữ biểu diễn nội dung của văn bản đầu vào. Bƣớc này thƣờng đƣợc chia thành các bƣớc nhỏ hơn: loại bỏ các ký tự thừa và ký tự nhiễu, chuẩn hóa các ký tự, tách từ và đánh chỉ số. Trong các bƣớc này thì bƣớc tách từ và đánh chỉ số là quan trọng nhất.Tuy nhiên cần phải chú ý đến tất cả các bƣớc vì chúng đều quyết định tốc độ của cả quá trình.Một mô hình chuẩn của bƣớc đánh chỉ số đƣợc miêu tả nhƣ hình 3.1.

Số hóa bởi Trung tâm Học liệu – Đại học Thái Nguyên http://www.lrc-tnu.edu.vn

Bước 2: Xác định độ phù hợp

Cũng giống nhƣ tìm kiếm văn bản, phân loại văn bản cần phải có bƣớc xử lý để chỉ ra rằng văn bản đang đƣợc phân tích thuộc về một nhóm nào đó dựa trên nội dung của văn bản hay chuỗi các thuật ngữ là biểu diễn của văn bản đó. Bộ phận phân này gọi là bộ phân loại.Nó cũng giống nhƣ bộ định dạng truy vấn trong tìm kiếm văn bản.Tuy nhiên, trong tìm kiếm văn bản mang tính nhất thời, còn trong phân loại văn bản thì mang tính ổn định hơn.Kết quả của quá trình này chỉ ra độ phụ thuộc giữa văn bản đang phân tích với mỗi nhóm có sẵn.Đây có thể coi là bƣớc mang tính quyết định trong cả quá trình phân loại.

Bước 3: So sánh

Trong hầu hết các bộ phân loại, mỗi văn bản đều đƣợc yêu cầu gán giá trị

đúng sai vào một lớp nào đó. Sự khác nhau lớn nhất với hệ thống tìm kiếm văn bản là ở đây quá trình so sánh chỉ đƣợc thực hiện một lần với số lƣợng so sánh hữu hạn tùy thuộc vào tập huấn luyện.Việc chọn quyết định phù hợp phụ thuộc chủ yếu vào quan hệ giữa các nhóm dùng để huấn luyện.

Bước 4: Phản hồi

Quá trình phản hồi đóng hai vai trò trong hệ thống phân loại văn bản. Thứ nhất, khi phân loại văn bản cần phải có một số lƣợng lớn các văn bản đã đƣợc phân loại bằng tay trƣớc đó, các văn bản này đƣợc sử dụng làm mẫu huấn luyện để hỗ trợ xây dựng bộ phân loại. Thứ hai, việc phân loại văn bản này không dễ dàng thay đổi nhƣ quá trình phản hồi trong tìm kiếm văn bản. Thay vì vậy, ngƣời dùng có thể

Hình 3.1: Các bước nhỏ trong quá trình đánh chỉ số

Loại nhiễu

Mã hóa ký tự

Đánh chỉ số

Văn bản thô chỉ số các thuật ngữ

Số hóa bởi Trung tâm Học liệu – Đại học Thái Nguyên http://www.lrc-tnu.edu.vn

thông tin cho ngƣời bảo trì hệ thống về việc xóa, thêm, hay sửa đổi các nhóm văn bản nào đó mình yêu cầu.

Một phần của tài liệu Ứng dụng giải thuật di truyền vào phân loại tài liệu dạng văn bản (Trang 50 - 52)

Tải bản đầy đủ (PDF)

(85 trang)