CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 3 upvote

ZooWork-ShopRanker: An Open, Preference-Aligned E-Commerce Reranker

CÂU HỎI — Làm thế nào để huấn luyện các mô hình reranker cho thương mại điện tử khi dữ liệu tìm kiếm thực tế thiếu nhãn cặp đôi sạch?

Nghiên cứu này giới thiệu ZooWork-ShopRanker, một họ các mô hình reranker cho thương mại điện tử với các kích thước 0.6B, 4B và 8B, được huấn luyện để giải quyết các quyết định xếp hạng phụ thuộc vào ràng buộc sản phẩm và sở thích người dùng. Do dữ liệu tìm kiếm thực tế không có sẵn nhãn cặp đôi, tác giả sử dụng một hội đồng các mô hình ngôn ngữ lớn làm bộ hướng dẫn đánh giá (preference oracle) với các phán đoán được khử thiên vị vị trí. Mô hình 8B sau đó đóng vai trò là giáo viên chưng cất kiến thức (distillation teacher) để huấn luyện các phiên bản nhỏ hơn gồm 4B và 0.6B. Đồng thời, họ ra mắt ShopRank-Bench, một benchmark ô nhiễm giới hạn gồm khoảng 10.000 cặp sở thích từ lưu lượng truy cập riêng tư để đo lường tiến độ.

Họ mô hình ZooWork-ShopRanker bao gồm các kích thước 0.6B, 4B và 8B được căn chỉnh dựa trên judge-labeled shopping preference.

Mô hình 8B được sử dụng làm distillation teacher để huấn luyện các phiên bản hiệu năng cao kích thước 4B và 0.6B.

ShopRank-Bench được giới thiệu là một contamination-limited benchmark bao gồm khoảng 10.000 private-traffic preference pairs.

Geralt-Targaryen · 25 thg 9, 2026 đọc bản gốc ↗
↑