CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 156 upvote

MaLiang-Harness: A Programmable Path to Image and Video Generation

CÂU HỎI — How to bridge the Program-to-Visual discrepancy in MLLM-driven visual generation through a persistent process of construction, inspection, and revision?

Bài báo xác định khoảng cách Program-to-Visual (P2V) trong việc sinh ảnh và video bằng code, sau đó giới thiệu MaLiang-Harness để tổ chức quá trình sinh hình ảnh bằng MLLM thành một chu trình liên tục gồm xây dựng, kiểm tra và sửa đổi. Hệ thống này duy trì trạng thái Persistent Executable Generation (PEG), kết nối các chỉnh sửa với bằng chứng render thông qua Traceable Generation Process (TGP), đồng thời kiểm tra lại trước khi hoàn thành với Revision-aware Editing and Verification (REV). Đánh giá trên MaLiang-IBench và MaLiang-VBench cho thấy các kết quả thực tế từ nhiều MLLM khác nhau.

MaLiang-Harness giải quyết khoảng cách Program-to-Visual (P2V) thông qua các cơ chế PEG, TGP và REV.

GPT-6-Astra đạt 100% generation success trên cả hai benchmark được đánh giá.

96.0% tác vụ ảnh và 76.9% tác vụ video của GPT-6-Astra đáp ứng toàn bộ các ngưỡng chất lượng.

ZhaoHaoyuu · 28 thg 9, 2026 đọc bản gốc ↗
↑