Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Tổng hợp trong ngàydo mô hình viết
01Xiaomi MiMo-V2.6 ra mắt trên OpenRouter và vLLMDòng mô hình MiMo-V2.6 của Xiaomi cùng cửa sổ ngữ cảnh 1M token đã chính thức có mặt trên cả nền tảng OpenRouter và vLLM.→ 2023
02OpenAI và Anthropic đồng loạt ra mắt mô…OpenAI và Anthropic đều giới thiệu các dòng mô hình mới kèm theo mức giá API được cắt giảm đáng kể so với các thế hệ trước.→ 0912
03Google đưa thử nghiệm TPU lên không gian…Google triển khai các nguyên mẫu vệ tinh mang theo bộ xử lý TPU để đánh giá khả năng vận hành trong điều kiện ngoài không gian.→ 0217
Video trong ngày
cuộn số 1 · 1:16
NHÃNarchitecture · 22 tiếng nói
Anthropic ra mắt Claude Opus 5.5 với chi phí vận hành thấp hơn 40%
Anthropic đã giới thiệu Claude Opus 5.5, mẫu mô hình đầu tiên trong dòng Claude 5.5, đạt hiệu suất tương đương Claude Fable 5.1 trong hầu hết các tác vụ nhưng có chi phí vận hành thấp hơn 40% so với Opus 5. Mô hình này cải thiện khả năng giao tiếp rõ ràng và tối ưu hóa lượng token sử dụng trên mọi mức độ nỗ lực.
Claude Code updates cloud sessions and usage limits
Claude Code ra mắt chính thức các phiên đám mây cho phép chạy khi tắt máy, đồng thời bổ sung cơ chế tìm điểm dừng mượt mà khi chạm giới hạn 5 tiếng. Nền tảng cũng khôi phục phí cho các yêu cầu bị chặn bởi bộ lọc bảo mật.
Google tests TPUs in space and publishes new DeepMind essays
Dự án Suncatcher của Google đưa nguyên mẫu vệ tinh tích hợp TPU lên không gian thông qua sứ mệnh của SpaceX. Google DeepMind cũng công bố các tiểu luận về việc kiểm soát hành vi trong bầy đàn tác nhân và phân phối công bằng lợi ích AGI.
Hugging Face reviews internet access for AI agents during evaluation
Hugging Face tiến hành đánh giá toàn diện về việc các tác nhân AI sử dụng internet trong quá trình huấn luyện và kiểm định. Cùng lúc đó, các mô hình diarization mới được giới thiệu để xử lý việc nhận diện nhiều người nói.
ChatGPT Voice integrates plugins and expands pricing tiers
ChatGPT Voice bổ sung khả năng sử dụng các plugin như email, lịch và Slack, đồng thời hỗ trợ trên web và di động. Nền tảng cũng chuẩn bị các gói đăng ký cao cấp mới với mức giá lên tới 500 USD.
Google introduces Gemini 3.8 Flash TTS and Flash-Lite TTS
Google giới thiệu Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS với hơn 2.000 giọng đọc sẵn sàng sản xuất, hỗ trợ 100 ngôn ngữ, thiết kế giọng nói mới và khả năng sao chép giọng nói.
Microsoft announces major GitHub Copilot update with Autopilot and GPT-6 models
Microsoft đã công bố bản cập nhật lớn cho GitHub Copilot, giới thiệu tính năng Autopilot chủ động cùng hai mô hình mới là GPT-6 Sol và GPT-6 Luna. Bản cập nhật này cũng đi kèm một ứng dụng Copilot mới với các chế độ Home, Code và Copilot nhằm kết nối các công cụ làm việc.
DigitalOcean launches Managed Agents in public preview
DigitalOcean đã phát hành DigitalOcean Managed Agents ở trạng thái public preview, cho phép người dùng chạy Claude Code, Codex hoặc các tác nhân LangGraph trong môi trường thời gian chạy tự động tạm dừng khi nhàn rỗi. Dịch vụ này tích hợp các công cụ đằng sau một điểm cuối được quản lý và cung cấp quyền truy cập từ hơn 75 nguồn mở.
Grok 4.7 xHigh scores 58% on Artificial Analysis AA-Briefcase benchmark
Grok 4.7 xHigh đạt 58% trên benchmark AA-Briefcase của Artificial Analysis, đứng sát phía sau Claude Fable 5.1 Max với 59%. Ngoài ra, mô hình ẩn danh Pixel Canary đã ra mắt trên Cline, đạt thành tích ngang bằng GPT-6 Astra và vượt qua Kimi K3 trên benchmark Next.js Agent Evals dành cho phát triển web và di động.
OpenAI đã ra mắt GPT-6 Sol và GPT-6 Luna, mang các điểm mạnh của GPT-6 Astra vào các mô hình nhanh hơn và tiết kiệm chi phí hơn để hỗ trợ công việc ở quy mô lớn. Giá API của cả hai mô hình này thấp hơn 50% so với GPT-5.6. Cùng lúc đó, công ty cũng giới thiệu Tesseract, bộ công cụ sáng tạo video dành cho các tác nhân AI.
Meta announces new features and integration partners for Muse at Connect
Tại sự kiện Connect, Meta đã công bố các hợp tác tích hợp chiến lược cho trợ lý cá nhân AI Muse với Shopify, Expedia và PayPal. Các liên minh này cho phép người dùng tìm kiếm sản phẩm, sắp xếp khách sạn và thực hiện thanh toán liền mạch thông qua trợ lý Muse trên toàn cầu.
Anthropic launches plugin submission portal and expands MCP integration
Anthropic đã ra mắt cổng thông tin mới giúp nhà phát triển gửi plugin, theo dõi kiểm duyệt và xem dữ liệu sử dụng cho Claude. Các plugin này đóng gói giao thức Model Context Protocol (MCP) và các kỹ năng chuyên biệt nhằm chuẩn hóa cách thức xây dựng ứng dụng trên nền tảng của Anthropic.
Anthropic launches Claude Opus 5.5 with 40% lower operational costs
Anthropic đã giới thiệu Claude Opus 5.5, mẫu mô hình đầu tiên trong dòng Claude 5.5, đạt hiệu suất tương đương Claude Fable 5.1 trong hầu hết các tác vụ nhưng có chi phí vận hành thấp hơn 40% so với Opus 5. Mô hình này cải thiện khả năng giao tiếp rõ ràng và tối ưu hóa lượng token sử dụng trên mọi mức độ nỗ lực.
Claude Sonnet 5.5 spotted in stealth testing with a 1M-token context window
Claude Sonnet 5.5 đang được thử nghiệm ẩn danh với cửa sổ ngữ cảnh 1 triệu token và độ dài đầu ra tối đa 128K token. Mức giá được ghi nhận cho mỗi triệu token là 2 USD cho đầu vào và 10 USD cho đầu vào/đầu ra, được giới chuyên môn nhìn nhận là phản ứng trực tiếp đối với các dòng mô hình cạnh tranh.
Anthropic speeds up Claude.ai performance by 3x in two weeks
Anthropic đã tăng tốc hiệu suất của trang claude.ai và ứng dụng desktop lên gấp 3 lần chỉ trong vòng hai tuần. Đội ngũ phát triển đã chia sẻ các phương pháp và câu lệnh cụ thể được sử dụng cùng Claude để đo lường, gỡ lỗi và cải thiện tốc độ.
Grok 4.7 launches with support from NVIDIA accelerated computing
SpaceXAI vừa phát hành mô hình Grok 4.7, được định vị là phiên bản có năng lực vượt trội nhất từ trước đến nay dành cho công việc viết mã và tri thức. Quá trình phát triển mô hình này có sự hỗ trợ phần cứng từ hệ thống tính toán tăng tốc của NVIDIA.
Sakana AI appoints Jürgen Schmidhuber as Chief Scientific Advisor
Jürgen Schmidhuber, nhà tiên phong trong lĩnh vực học siêu cấp, tự cải thiện đệ quy và mô hình thế giới từ những năm 1990, đã chính thức gia nhập Sakana AI với tư cách là Cố vấn Khoa học Trưởng. Cùng lúc đó, công ty cũng giới thiệu Agora-2, mô hình thế giới đa tác nhân thế hệ mới hỗ trợ tương tác thời gian thực cho tối đa 20 người và tác nhân.
Google launches a satellite to test TPU performance in orbit
Google hợp tác cùng công ty Planet phóng một vệ tinh nguyên mẫu mang theo bốn bộ xử lý Tensor (TPU) vào không gian quỹ đạo. Dự án này nhằm mục đích đánh giá khả năng chịu đựng của phần cứng trước điều kiện khắc nghiệt ngoài vũ trụ và kiểm tra tiềm năng triển khai máy học trên quỹ đạo.
Apple releases a Qwen3.5-9B finetune converting documents into images
Apple vừa phát hành trên nền tảng Hugging Face một mô hình tinh chỉnh dựa trên Qwen3.5-9B có khả năng chuyển đổi các tài liệu dài thành các hình ảnh trang nhỏ nhằm tiết kiệm lượng mã thông báo, sau đó trích xuất toàn bộ văn bản của những trang liên quan trực tiếp đến truy vấn.
Agent harnesses integrate System One models and Contrastive Language Model
Cộng đồng xây dựng agent đang thử nghiệm các mô hình System One như Jev và Contrastive Language Model trong bộ khung tùy chỉnh. Những mô hình này đóng vai trò bộ định tuyến hoặc bộ xác thực tốc độ cao để cải thiện hiệu suất cho các tác vụ agent.
Xiaomi MiMo-V2.6 and System One model Jev launch on OpenRouter
Nền tảng OpenRouter bổ sung hàng loạt mô hình mới bao gồm dòng Xiaomi MiMo-V2.6 đa phương thức với cửa sổ ngữ cảnh 1M token và mô hình System One Jev. Các nhà phát triển đang thử nghiệm các mô hình này cho các ứng dụng yêu cầu phản hồi nhanh.
4 tài khoản độc lập37 bài1 bài viết13.047 tương tác
Xiaomi MiMo-V2.6-Pro tops open weights model benchmarks
MiMo-V2.6-Pro đạt vị trí số một trên bảng xếp hạng Artificial Analysis Intelligence Index dành cho mô hình trọng số mở. Mô hình sử dụng kiến trúc Grouped Query Attention kinh điển và đạt hiệu quả chi phí cạnh tranh trên mỗi tác vụ.
New research explores distillation and reinforcement learning for agents
Các nhà nghiên cứu công bố phương pháp hậu huấn luyện giúp agent học hỏi từ phiên làm việc thực tế của người dùng thông qua việc bắt chước quỹ đạo tốt và sửa lỗi. Một nghiên cứu khác từ Google đánh giá tác động của việc chưng cất bộ khung agent đối với tỷ lệ hoàn thành tác vụ.
vLLM adds day-one support for Xiaomi MiMo-V2.6 and DiffusionGemma-Jev
Hệ thống vLLM triển khai hỗ trợ ngay lập tức cho các mô hình MiMo-V2.6 dung lượng lớn và DiffusionGemma-Jev. Các phiên bản Pro và Flash đều mang lại khả năng xử lý ngữ cảnh dài và đa phương thức trên nền tảng phục vụ.
Tencent ARC Lab releases GameHorizon Suite for evaluating game agents
Tencent ARC Lab giới thiệu bộ công cụ dữ liệu và đánh giá GameHorizon Suite nhằm đo lường năng lực chơi game AAA qua nhiều mốc thời gian đối với các mô hình đa phương thức, mô hình GUI và agent lập trình.
Anthropic hackathon winner open-sources complete Claude Code setup
Quán quân cuộc thi hackathon của Anthropic đã công bố mã nguồn toàn bộ thiết lập Claude Code, bao gồm các kỹ năng đại diện, tiện ích bổ sung và kinh nghiệm thực tế. Cùng lúc đó, các nghiên cứu mới giới thiệu phương pháp tiến hóa kỹ năng đại diện giúp giảm 40 đến 70 phần trăm chi phí mã thông báo so với các phương pháp biên, cũng như công trình chuyển đổi kỹ năng thành môi trường học tăng cường từ NVIDIA.
Alibaba announces infrastructure plans and next-generation Qwen models
Alibaba đặt mục tiêu đạt 20 gigawatt công suất trung tâm dữ liệu toàn cầu vào năm 2032 để phục vụ tham vọng trí tuệ nhân tạo tổng hợp, cùng kế hoạch phát triển mô hình Qwen từ 5 đến 10 nghìn tỷ tham số và các dòng chip AI thế hệ mới. Ngoài ra, nhóm Qwen vừa phát hành sandbox RecreationWorld trên Hugging Face để các đại diện sử dụng máy tính kiểm tra và xây dựng ứng dụng.
CÂU HỎI — Làm thế nào để cải thiện LLM agents bằng cách mô hình hóa tiến trình nhiệm vụ và chỉnh sửa trạng thái reasoning thay vì chỉ dự đoán phản hồi từ tool?
AEWM đạt 70.5% macro-F1 trên Action Judge benchmark, vượt baseline mạnh nhất 10.6 điểm.
CÂU HỎI — Làm thế nào để xây dựng một tác nhân hội thoại đồng hành trong trò chơi thời gian thực, đáp ứng các ràng buộc về độ trễ và phối hợp nhịp nhàng với người chơi?
Thu thập dữ liệu qua gần 39k phiên chơi thực tế kết hợp người chơi và tác nhân để huấn luyện lặp đi lặp lại.
CÂU HỎI — Làm thế nào để cải thiện tính tổng quát hóa của tác vụ sinh hình ảnh trong các MLLM và hệ thống multi-agent mà không cần fine-tune trọng số model?
OmniHarness đạt 95.0% resolve rate trên ComfyBench's Creative tasks, vượt baseline mạnh nhất 27.5 percentage points.
CÂU HỎI — Liệu các coding agent có thể tự động hóa việc tổng hợp chương trình để giải quyết các bài toán lập kế hoạch tác vụ và chuyển động (TAMP) tổng quát không?
Nghiên cứu đánh giá 980 chương trình được sinh ra trên 100 trường hợp giữ lại cho mỗi chương trình, tổng cộng có 98.000 tập đánh giá.
CÂU HỎI — Làm thế nào để tự động sinh ra các trường hợp biên (edge case) phục vụ đánh giá và tối ưu hóa agent gọi công cụ mà không cần chú thích thủ công từ con người?
Fine-tuning trên dữ liệu EdgeGen mang lại mức cải thiện tiến độ trung bình từ 2 phần trăm đến 42 phần trăm trên miền hàng không tau2bench.
CÂU HỎI — Các hệ thống multi-agent dài hạn phản ứng như thế nào trước các sự kiện căng thẳng đối kháng khi hoạt động liên tục trong môi trường chia sẻ?
Hệ thống tạo ra hơn 850,000 LLM calls và gần 50 tỷ token trong suốt 16 ngày vận hành trên tám thế giới song song.
CÂU HỎI — Liệu các tác nhân viết mã (coding agents) có thể cung cấp giám sát có khả năng mở rộng để huấn luyện chính sách robot khéo léo dài hạn không?
Frontier coding agents có thể giải quyết các tác vụ tương tác phong phú, biến dạng và kéo dài tới nửa giờ tương tác liên tục.
CÂU HỎI — Làm thế nào để cải thiện đồng thời độ chính xác suy luận và hiệu năng tính toán của LLM thông qua việc kết hợp các khả năng đã học độc lập?
On Qwen3.5-4B, it raises HMMT 2025 accuracy from 59.2% to 64.0% with 10.7% fewer response tokens, and LiveCodeBench v5 accuracy from 41.7% to 54.2% with 9.6% fewer response tokens.
CÂU HỎI — Làm thế nào để các đội ngũ tác nhân AI có thể tự tổ chức học hỏi chiến lược hợp tác và giải quyết các bài toán phức tạp vượt quá năng lực của từng thành viên?
Các đội tự tổ chức đạt độ chính xác trung bình 66.7% trên năm benchmark toán học và vật lý, so với 48.8% của thành viên mạnh nhất.
CÂU HỎI — Làm thế nào để trích xuất và phân tích chuỗi suy luận ẩn (hidden CoT) từ các mô hình ngôn ngữ lớn đóng kín thông qua API tiêu chuẩn?
Nghiên cứu này khai thác một custom tool đơn giản đăng ký qua API tiêu chuẩn để ép các mô hình biên (frontier models) ngoại hóa quá trình suy luận trung gian vốn bị ẩn trong các hệ thống đóng. Bằng cách so sánh với native CoT trên các mô hình mở và mở rộng sang các hệ thống như GPT-6 Astra, các tác giả chứng minh rằng chuỗi suy luận được trích xuất đạt hiệu suất tương đương native CoT và vượt trội hơn hẳn các baseline không có suy luận trong các bài toán toán học cạnh tranh, khoa học và sinh mã. Phân tích cấu trúc cho thấy các mô hình như Astra thể hiện khả năng hướng dẫn suy luận hiệu quả về token, xử lý các bước sơ cấp bên trong và chỉ ngoại hóa các phần cốt lõi.
CÂU HỎI — Làm thế nào để giải quyết vấn đề tín hiệu học tập bị lẫn lộn trong tối ưu hóa reinforcement learning cho việc sinh đồng thời âm thanh và video?
AV-GRPO vượt trội hơn LTX-2.3 về chất lượng sinh, căn chỉnh ngữ nghĩa và đồng bộ hóa chéo phương thức dưới dạng LoRA và fine-tuning toàn phần.
CÂU HỎI — Làm thế nào để cải thiện hiệu suất và độ trễ của world-action models trong điều khiển robot bimanual?
DeltaWAM với SDM cải thiện độ chính xác trung bình trên RoboTwin từ 81,3% lên 85,4% trong môi trường sạch và từ 75,8% lên 83,9% dưới điều kiện ngẫu nhiên hóa hình ảnh.
CÂU HỎI — Có thể loại bỏ hoàn toàn teacher-critic stack tốn kém trong việc huấn luyện hậu kỳ video tạo sinh bằng cách nào?
With only 20 generator updates, the recipe reaches 84.87 on the official VBench evaluation, outperforming the previous best few-step causal baseline by 0.36, while requiring 16 A100 GPU-hours.
CÂU HỎI — Làm thế nào để cải thiện cấu trúc trung gian và sự giám sát trong việc lập kế hoạch tác vụ dài hạn cho các hệ thống Vision-Language-Action?
X-Planner xếp thứ hai trong bốn mô hình được đánh giá trên cả BERTScore-F1 lẫn điểm Overall dựa trên giám khảo trong đánh giá lập kế hoạch ngoại tuyến hai bước.
CÂU HỎI — Làm thế nào để phát hiện các lỗi căn chỉnh của mô hình ngôn ngữ lớn một cách hiệu quả và tiết kiệm chi phí mà không cần dùng đến các giám khảo sinh văn bản tốn kém?
Jev đạt giá trị AUROC trung vị là 0.886 ở chế độ zero-shot trên RLCDAlignBench.