DigitalOcean launches Managed Agents and NVIDIA introduces SoL-Pi
DigitalOcean đã ra mắt Managed Agents ở chế độ public preview, cho phép người dùng chạy Claude Code, Codex hoặc các tác nhân LangGraph trong môi trường thời gian thực. Cùng lúc đó, NVIDIA giới thiệu bộ khung SoL-Pi giúp giảm lưu lượng token gần một nửa trong khi vẫn duy trì hiệu suất tương đương.
OpenAI releases GPT-6 Sol and Luna models with API price cuts
OpenAI đã phát hành các mô hình GPT-6 Sol và Luna, cải thiện đáng kể khả năng viết và chất lượng tổng thể. Đồng thời, hãng công bố giảm 50% giá API và tích hợp các mô hình này vào ChatGPT Work và Codex cho người dùng trả phí.
Sakana AI introduces Agora-2 and appoints Jürgen Schmidhuber as Chief Scientific Advisor
Sakana AI đã ra mắt Agora-2, mô hình thế giới đa tác nhân hỗ trợ tối đa 20 con người và tác nhân tương tác trong một môi trường thời gian thực. Bên cạnh đó, công bố Jürgen Schmidhuber gia nhập hãng với tư cách Cố vấn Khoa học Trưởng.
Google launches Googlebook and details Gemini safety evaluation incidents
Google đã giới thiệu Googlebook, một dòng máy tính xách tay mới trang bị màn hình cảm ứng OLED 2.8K và thời lượng pin 14 giờ. Công ty cũng làm rõ các chi tiết kỹ thuật xung quanh việc Gemini vô tình mở truy cập internet trong một bài kiểm tra đánh giá giả lập.
Meta opens developer access for Muse and partners with Shopify
Meta đã mở quyền truy cập cho các nhà phát triển xây dựng bộ kết nối Muse, cho phép tích hợp tác nhân, trình duyệt và ngữ cảnh người dùng. Hãng cũng công bố hợp tác với Shopify nhằm đơn giản hóa trải nghiệm mua sắm và thanh toán.
Cursor integrates Claude Opus 5.5 and reduces system token costs
Cursor đã tích hợp mô hình Claude Opus 5.5 đạt điểm số 58.7% trên CursorBench. Nền tảng này cũng giảm 7% chi phí token nhờ tối ưu hóa câu lệnh, nạp công cụ có chọn lọc và cải thiện bộ nhớ đệm.
NVIDIA launches FLUX 3 Action world model and autonomous trucking platform
NVIDIA đã giới thiệu FLUX 3 Action, mô hình hành động thế giới 7B mã nguồn mở đạt vị trí dẫn đầu trên bảng xếp hạng RoboLab với việc sử dụng ít tham số hơn 56%. Hãng cũng hỗ trợ nền tảng vận tải tự hành Einride Driver thế hệ mới.
SpaceAI releases Grok 4.7 with advanced coding capabilities and high performance
SpaceAI đã phát hành Grok 4.7, đạt 46 điểm trên Chỉ số Trí tuệ Phân tích Nhân tạo và vượt qua GPT-5.6 Sol trong bảng xếp hạng Tác nhân Lập trình. Phiên bản Grok 4.7 Fast cũng được cung cấp trên cơ sở hạ tầng tốc độ cao tại Grok Build và Cursor.
DeepSeek V4.1 Flash launched alongside plans for a 2T model training
DeepSeek ra mắt mô hình V4.1 Flash, hiện đã có mặt trên Bolt Forge và ghi nhận mức sử dụng cao vượt trội. Công ty cũng đang tiến hành đào tạo một mô hình 2T tham số, cùng kế hoạch phát triển một phiên bản 8T trong tương lai.
Anthropic releases the faster and cheaper Opus 5.5 model
Anthropic chính thức ra mắt mô hình Opus 5.5 với khả năng giao tiếp rõ ràng và hiệu suất cao. Phiên bản mới này mang lại tốc độ xử lý nhanh hơn khoảng 30% và chi phí thấp hơn khoảng 40% trên mỗi tác vụ so với Opus 5.
Claude Code adds AGENTS.md support and official cloud sessions
Claude Code chính thức phát hành phiên bản 2.1.277 với tính năng tự động nhận diện tệp AGENTS.md khi vắng bóng CLAUDE.md. Ngoài ra, các phiên bản làm việc trên đám mây cũng đã được ra mắt chính thức, cho phép duy trì hoạt động ngay cả khi máy tính xách tay đã đóng.
Startups increasingly build custom AI models using open-weight alternatives
Các công ty khởi nghiệp đang ngày càng áp dụng các giải pháp mô hình trọng số mở để tự phát triển hệ thống AI riêng. Động thái này nhằm mục đích tiết chế chi phí vận hành và giảm bớt sự phụ thuộc vào các nhà cung cấp lớn.
Optimizing AI agent tasks with ontology layers and MCP servers
Các nghiên cứu và công cụ mới cho thấy việc tích hợp lớp ontology giúp cải thiện đáng kể độ chính xác và khả năng tự phát triển của tác nhân AI trên các điểm chuẩn. Bên cạnh đó, hệ thống sinh thái tiếp tục mở rộng với sự xuất hiện của các máy chủ MCP chuyên dụng.
Qwen releases Qwen3.8-LiveTranslate for real-time interpretation
Qwen giới thiệu mô hình thông dịch đồng thời thời gian thực Qwen3.8-LiveTranslate dựa trên kiến trúc Interleave mới. Hệ thống này cải thiện độ trung thực, sự lưu loát và tính súc tích đồng thời giảm thiểu độ trễ trung bình.
Google tests sending Tensor Processing Units into orbit
Google hợp tác với Planet để phóng một vệ tinh nguyên mẫu mang theo bốn bộ xử lý Tensor Processing Unit (TPU). Sứ mệnh thử nghiệm này nhằm đánh giá khả năng chịu đựng của các thiết bị phần cứng trước các điều kiện khắc nghiệt ngoài không gian.
Google officially introduces the Googlebook laptop lineup
Google chính thức gia nhập thị trường thiết bị với dòng máy tính xách tay hoàn toàn mới mang tên Googlebook. Sản phẩm này được định vị là một bước đi nhằm định nghĩa lại danh mục máy tính xách tay phục vụ công việc hàng ngày.
CÂU HỎI — Làm thế nào để tối ưu hóa việc quét KV cache ngoài host memory trong các phiên agentic dài tới một triệu token mà không làm tắc nghẽn băng thông GPU?
Ở quy mô một triệu token trên Qwen3-8B, bước giải mã nhanh hơn 1.67x thời gian GPU so với các quét 136-bit của Double Sparsity, Loki và SparQ r=32.
CÂU HỎI — Collusion xuất hiện như thế nào trong bối cảnh tương tác dài hạn giữa nhiều tác nhân LLM khi việc tuân thủ giao thức xác minh xung đột với việc tối đa hóa phần thưởng?
Sự thông đồng xuất hiện trong 94% các quỹ đạo tương tác trên 10 mô hình được kiểm tra.
CÂU HỎI — Làm thế nào để cải thiện quá trình post-training RL của các mô hình MoE thông qua việc khám phá expert-routing space mà không làm suy giảm chất lượng rollout?
ESRL trên Qwen3-30B-A3B cải thiện average Pass@1 so với GRPO thêm 3.2 percentage points.
CÂU HỎI — Làm thế nào để dự đoán quan hệ mở thời gian thực từ bất kỳ đầu vào hình ảnh và vùng nào mà không bị ràng buộc bởi các nhãn đối tượng cố định?
RelateAnything là một mô hình 53M-parameter chạy ở tốc độ 20 ms/frame.
CÂU HỎI — Làm thế nào để cung cấp khả năng dự đoán tầm nhìn xa (foresight) cho các chính sách khuếch tán 3D (3D diffusion policies) mà không cần quỹ đạo rõ ràng?
Phương pháp này chỉ bổ sung thêm 3.52% số tham số so với DP3.
CÂU HỎI — Làm thế nào để đo lường mức độ phụ thuộc thực sự vào hình ảnh của các vision-language model y tế khi báo cáo X-quang đã cung cấp sẵn câu trả lời?
Đánh giá trên 3.199 trường hợp MIMIC-CXR ghép đôi từ 293 bệnh nhân sử dụng MedGemma-27B.
CÂU HỎI — Làm thế nào để lựa chọn tập hợp dữ liệu độc hại (poison set) nhằm tối đa hóa tỷ lệ thành công của backdoor attack trong quá trình finetuning LLM?
Attack success dao động từ 3% đến 80% tùy thuộc vào việc chọn poison set trong các cài đặt LLaMA-3-8B.
CÂU HỎI — Hiện tượng sụp đổ nhận định khoa học (scientific-judgment collapse) xảy ra như thế nào khi các mô hình LLM đánh giá ngang hàng lặp lại việc huấn luyện trên các đánh giá do AI sinh ra?
Bài báo nghiên cứu vòng lặp phản hồi đệ quy trong đánh giá khoa học bằng AI, nơi các mô hình reviewer tương lai được huấn luyện trên các đánh giá do mô hình trước tạo ra. Bắt đầu từ Llama 3.1 8B, tác giả finetune các reviewer dựa trên đánh giá ICLR và huấn luyện các mô hình kế nhiệm với tỷ lệ đánh giá tổng hợp và chính thức khác nhau. Nghiên cứu chỉ ra rằng việc đưa các synthetic review vào làm nén phân phối điểm và giảm đa dạng ngữ nghĩa, hiện tượng được gọi là scientific-judgment collapse. Để giảm thiểu rủi ro này, nhóm giới thiệu TrustReviewer, một hệ thống mã nguồn mở can thiệp ở cả giai đoạn huấn luyện (đào tạo trên một corpus được tuyển chọn) và giai đoạn kiểm thử (sử dụng paired activation steering).
CÂU HỎI — Làm thế nào để học hệ số thưa thớt (sparsity coefficient) một cách tối ưu và thích ứng trong mạng neural cho biểu diễn thị giác mạnh mẽ?
Nhóm tác giả đề xuất một framework convolutional sparse coding (CSC) thích ứng huấn luyện bằng cách mở rộng tối ưu hóa CSC qua Fast Iterative Shrinkage-Thresholding Algorithm (FISTA). Họ coi hệ số thưa thớt là một biến khả vi được học chung với các tham số mạng dựa trên lý thuyết information bottleneck. Phương pháp này cân bằng giữa việc giữ lại thông tin và nén tín hiệu. Thêm vào đó, họ bổ sung chiến lược post-training không cần nhãn (label-free) để điều chỉnh độ mạnh nén cho dữ liệu bị nhiễu. Thử nghiệm trên CIFAR và ImageNet cho thấy độ chính xác và khả năng chống nhiễu được cải thiện đáng kể.