MSO Cloud · Documentation

Phân loại thảo luận

Source: docs/product/content-taxonomy.md Updated 2026-09-21
On this page

Xưởng từ vựng của một bộ dữ liệu thảo luận: nơi sửa tên nhóm, thêm giá trị, gán cách viết khác vào đúng giá trị, và theo dõi phần chưa phân loại — cho corpus mà một tổ chức Content Intelligence đã nạp.

Dành cho: quản trị viên hoặc biên tập viên của một tổ chức chạy trụ Thảo luận khách hàng (Content Intelligence), sau khi corpus đã được nạp. Điều kiện trước: tổ chức có ít nhất một bộ dữ liệu đã đăng ký; nạp corpus lần đầu là một bước riêng, xem phần cuối trang.

Một bộ dữ liệu, một từ vựng#

Màn hình luôn sửa đúng một bộ dữ liệu tại một thời điểm — thanh chọn bộ dữ liệu ở đầu trang quyết định corpus nào đang mở, và lựa chọn đó nằm trong đường dẫn (?dataset=) nên tải lại trang hay chia sẻ liên kết vẫn giữ đúng bộ dữ liệu. Một tổ chức giao nhiều kỳ (ví dụ mỗi quý một corpus) đăng ký mỗi kỳ là một bộ dữ liệu riêng; mọi sửa đổi trên trang — thêm giá trị, gán cách viết, đổi hiển thị — đi kèm khoá của bộ dữ liệu đang chọn, nên sửa trong lúc xem kỳ này không bao giờ lạc sang kỳ khác.

Tổ chức chưa có bộ dữ liệu nào thấy đúng một biểu mẫu: Tạo bộ dữ liệu. Nếu thương hiệu khác của cùng tổ chức đã có một corpus với từ vựng gần giống, Nhân bản sao chép toàn bộ nhóm, giá trị và cặp chéo sang thương hiệu mới, và có thể chép kèm mẫu ánh xạ dùng để nạp file — kết quả nói rõ những gì đã sao chép, không phải một chữ "thành công" trống.

Nhóm nội dung và giá trị#

Từ vựng của một bộ dữ liệu là danh sách nhóm nội dung (dimension) — ví dụ "Rào cản mua hàng", "Giai đoạn hành trình" — mỗi nhóm chứa các giá trị (value) là những nhãn cụ thể bên trong nhóm đó. Mỗi nhóm mang ba thuộc tính quyết định nó hoạt động thế nào trong báo cáo: dạng dữ liệu (chọn một, chọn nhiều, giai đoạn có thứ tự, cây cha–con, cờ đúng/sai…), vai trò (chủ đề chính, cảm xúc, giai đoạn, thực thể…) và vị trí hiển thị trên bảng điều khiển (chính, phụ, chẩn đoán, hoặc ẩn). Ba ô này lấy đúng danh sách lựa chọn mà cơ sở dữ liệu chấp nhận — màn hình không tự bịa ra một lựa chọn mà backend sẽ từ chối.

Danh sách nhóm mở gấp lại theo mặc định và có ô tìm kiếm ở trên cùng: một corpus giao có thể có một nhóm chứa hàng trăm giá trị, nên xem toàn bộ danh sách mở sẵn là không thực tế. Tìm theo tên nhóm, tên giá trị hoặc cách viết khác đều ra kết quả — tìm một giá trị thì mở đúng nhóm chứa giá trị đó.

Mỗi giá trị mới thêm vào ở trạng thái chờ duyệt ("chưa phân loại") cho đến khi có người bấm Xác nhận; số lượng chờ duyệt luôn hiện trên đầu mỗi nhóm, kể cả khi bằng không, vì một giá trị bị bỏ sót là một dòng dữ liệu lặng lẽ rơi khỏi báo cáo giao cho khách. Một giá trị có thể bị Loại (chuyển sang trạng thái bị từ chối, không tự quay lại), hoặc Gộp vào một giá trị khác đang hoạt động.

Sửa hiển thị và sửa cách tính là hai việc khác nhau#

Đổi tên hiển thị, màu hoặc thứ tự sắp xếp của một nhóm hay một giá trị là sửa trình bày — áp dụng ngay, không ảnh hưởng số liệu đã tính. Đổi dạng dữ liệu, vai trò, nền tối thiểu hoặc sàn độ phủ của một nhóm — hoặc thêm/loại/gộp giá trị, xác nhận cách viết — là sửa cách tính: hành động này tạo một phiên bản từ vựng mới và đưa corpus vào trạng thái "cần nạp lại", vì các nhãn đã gắn vào dữ liệu cũ không còn khớp với từ vựng hiện tại. Màn hình cảnh báo rõ khi corpus đang ở trạng thái này, và phân biệt hai loại sửa bằng chính hành động — không có nút nào trông giống việc nhẹ nhưng làm việc nặng.

Cách viết khác#

Một khái niệm có thể xuất hiện dưới nhiều cách viết trong dữ liệu thô (ví dụ "ship chậm" và "giao trễ" cùng chỉ một rào cản). Mỗi nhóm có bảng Cách viết khác riêng: gán một cách viết vào đúng giá trị luôn cần người xác nhận — hệ thống không tự gán theo số lần xuất hiện. Khi gõ một cách viết mới, màn hình gợi ý những giá trị đã có cách viết trùng khớp hoặc gần giống (có dấu, gần giống dấu); gợi ý gần giống chỉ là gợi ý để người kiểm tra, không tự động gán, vì việc bỏ dấu tiếng Việt có thể gộp nhầm hai từ khác nghĩa.

Cặp chéo#

Một cặp chéo là khai báo "xem nhóm A cắt theo nhóm B" — ví dụ rào cản cắt theo phân khúc khách hàng — dùng để dựng biểu đồ ma trận trên báo cáo. Cặp chéo là một khai báo tường minh, không phải hệ thống tự suy ra: khai một cặp mới hoặc gỡ một cặp đang dùng đều là thao tác trên chính màn hình này, và ma trận tương ứng chỉ xuất hiện sau lần làm mới báo cáo kế tiếp. Một nhóm mang vai trò "bằng chứng" (evidence, dùng để trích dẫn chứ không phải để đếm) không tham gia cặp chéo.

Gợi ý từ AI#

Khi tổ chức đã cấu hình AI, màn hình có một khối Đề xuất từ AI xin danh sách sửa đổi cho từ vựng hiện tại. Khối này chỉ hiện thị sai khác — giá trị hiện tại cạnh giá trị được đề xuất, kèm lý do — và người dùng xác nhận từng dòng một; không có nút "chấp nhận tất cả". Xác nhận một đề xuất đi qua đúng những API sửa trình bày hoặc gán cách viết mà chính người dùng có thể gọi tay, nên không có đường ghi riêng nào bỏ qua kiểm tra quyền.

Receipt chất lượng nhãn#

Trước khi một corpus có thể giao cho khách qua liên kết công khai, đội vận hành ghi lại kết quả gán nhãn lại độc lập (mức đồng thuận theo từng nhóm) ngay trên trang này — đây là bằng chứng bắt buộc, không phải một số liệu nội bộ tách rời khỏi màn hình sửa nhãn.

Nạp corpus lần đầu#

Đăng ký một bộ dữ liệu mới trên trang này chỉ là bước cuối của việc onboarding một corpus — bước tải file, ánh xạ cột và soạn tệp taxonomy nằm trước nó. Với một corpus tiêu chuẩn, luồng đó chạy qua upload → ánh xạ → tạo bộ dữ liệu ngay trên giao diện; với một corpus có cấu trúc lạ (hai file cần nối, định dạng ô khác thường, khối lượng lớn) quy trình vận hành dùng kỹ năng content-corpus-onboarding.

Liên quan#