VisionHOPE: Visual Backbones as Self-Modifying Learning Systems
Các tác giả giới thiệu VisionHOPE, một visual backbone tổng quát dưới dạng hệ thống học tự sửa đổi (self-modifying learning system), nơi nội dung ghi nhớ và quy tắc học tập cùng tiến hóa trong quá trình xử lý ảnh. Dựa trên cấu trúc tự quy chiếu của Nested Learning (NL), mô hình kết hợp năm vùng nhớ liên kết điều khiển nội dung, sinh key-value, học phí và khả năng lưu trữ. Để chống mất ổn định, họ áp dụng chiến lược điều khiển bước nhảy ghép cặp độ ổn định (stability-matched step-size control) cùng tính toán chuyển đổi bộ nhớ phi mở rộng dọc theo mỗi lần quét. Kết quả cho thấy backbone này đạt hiệu suất cạnh tranh trên ImageNet-1K, COCO và ADE20K.
VisionHOPE là backbone visuel tổng quát đầu tiên được xây dựng dưới dạng hệ thống học tự sửa đổi.
Hệ thống tích hợp năm vùng nhớ liên kết cùng tiến hóa trong quá trình quét ảnh.
VisionHOPE đạt kết quả cạnh tranh trên các tập dữ liệu ImageNet-1K, COCO và ADE20K.