Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Video trong ngày
cuộn số 3 · 1:07
NHÃNarchitecture · 22 tiếng nói
Giới thiệu mô hình Claude Opus 5.5 với chi phí vận hành thấp hơn 40%
Mô hình Claude Opus 5.5 chính thức ra mắt, đạt hiệu năng tương đương Claude Fable 5.1 trong phần lớn các tác vụ nhưng có chi phí vận hành thấp hơn 40% so với phiên bản Opus tiền nhiệm. Bản cập nhật này cũng mang lại cải tiến về tốc độ và hiệu quả sử dụng token.
Anthropic launches Claude Sonnet 5.5 with higher speed and lower cost
Anthropic đã phát hành Claude Sonnet 5.5, mang lại cải thiện về hiệu suất và đạt 56 điểm trên Artificial Analysis Intelligence Index. Mô hình này chạy nhanh hơn 30% và có chi phí thấp hơn tới 30% so với thế hệ trước, đồng thời đi kèm các biện pháp bảo vệ an toàn mạng mới.
NVIDIA introduces Open Agent Safety Platform with OpenShell and Sentry
NVIDIA đã công bố Open Agent Safety Platform, được thiết kế để cung cấp không gian thực thi bảo mật cho các tác nhân trí tuệ nhân tạo. Nền tảng này kết hợp OpenShell và Sentry nhằm thiết lập các ranh giới rõ ràng và theo dõi hoạt động của tác nhân.
Muse launches hardware device and AI assistant phone call features
Nền tảng trợ lý cá nhân Muse công bố các tính năng gọi điện thoại mới cùng thiết bị đeo tay Muse Charm dự kiến giao hàng vào tháng 12. Công ty cũng hợp tác với các đối tác thương mại điện tử và thanh toán để tích hợp tác nhân AI vào quy trình mua sắm.
Community discussions on satirical media regarding artificial intelligence
Truyền thông và cộng đồng trực tuyến đang bàn luận về các chương trình truyền hình châm biếm hình ảnh của các nhà lãnh đạo và các phòng thí nghiệm trí tuệ nhân tạo trong bối cảnh các đợt huy động vốn lớn.
OpenAI resolves service disruption affecting Codex
Hệ thống Codex đã gặp phải tình trạng ngừng hoạt động ngoài dự kiến, khiến dịch vụ phải tạm dừng. Đội ngũ kỹ thuật đã khôi phục hoàn toàn và đưa hệ thống trở lại hoạt động bình thường.
Claude Code updates cloud sessions and mid-task limit handling
Claude Code bổ sung cơ chế dùng hạn mức nhỏ để hoàn tất công việc khi chạm trần 5 tiếng, đồng thời chính thức phát hành các phiên làm việc trên đám mây. Bản cập nhật cũng đưa vào hoạt động nền tảng quản lý tác vụ và tiếp tục thu phí với các yêu cầu bị bộ lọc chặn.
Google launches Gemini 3.8 Flash TTS text-to-speech models
Google giới thiệu Gemini 3.8 Flash TTS và Flash-Lite TTS với khả năng hỗ trợ hơn 100 ngôn ngữ và kho giọng đọc sẵn sàng cho sản xuất. Các mô hình này cung cấp tính năng thiết kế giọng nói tùy chỉnh, đối thoại hai người và chỉnh sửa chi tiết từng dòng.
Grok records rapid usage growth and rolls out new features
Mức độ sử dụng chatbot Grok ghi nhận đà tăng trưởng nhanh chóng cùng hàng loạt tính năng mới được bổ sung, bao gồm khả năng quản lý tài chính. Bên cạnh đó, phiên bản mô hình kích thước nhỏ Grok 4.7 đạt hiệu suất khả quan.
OpenAI prepares for DevDay and expands capabilities for Astra
Đội ngũ phát triển chuẩn bị cho sự kiện DevDay với nhiều cập nhật nhằm thay đổi quy trình làm việc. Hệ thống Astra ghi nhận các bước tiến mới trong việc tạo dựng không gian 3D chi tiết và vận hành tác vụ.
ChatGPT integrates workspace tools and expands high-tier subscription plans
ChatGPT bổ sung khả năng sử dụng các tiện ích mở rộng như email, lịch và Slack thông qua chế độ giọng nói, đồng thời ra mắt bộ công cụ sáng tạo video Tesseract. Nền tảng cũng chuẩn bị điều chỉnh cấu trúc giá với các gói dịch vụ cao cấp mới.
GitHub Copilot announces major update featuring proactive Autopilot
GitHub Copilot triển khai bản cập nhật lớn nhất từ trước đến nay, tích hợp tính năng Autopilot mang lại khả năng hỗ trợ chủ động. Nền tảng cũng bổ sung thêm hai mô hình mã hóa mới và giới thiệu giao diện ứng dụng Copilot với các chế độ Home, Code và Copilot.
GPT-6 Sol and GPT-6 Luna launched with API prices 50% lower
Dòng mô hình GPT-6 Sol và GPT-6 Luna vừa được giới thiệu nhằm mang lại hiệu năng cao với mức giá dễ tiếp cận hơn cho việc mở rộng quy mô. Cả hai mô hình đều có giá API rẻ hơn 50% so với thế hệ tiền nhiệm.
Claude expands plugin ecosystem and Model Context Protocol adoption
Nền tảng hỗ trợ phát triển plugin và giao thức ngữ cảnh mô hình (MCP) đang được mở rộng nhằm đơn giản hóa việc tích hợp công cụ và dữ liệu. Lượng sử dụng MCP ngày càng tăng trong hệ sinh thái của Claude giúp kết nối đa dạng các nguồn dữ liệu bên ngoài.
Claude Opus 5.5 introduced with 40% lower operating costs
Mô hình Claude Opus 5.5 chính thức ra mắt, đạt hiệu năng tương đương Claude Fable 5.1 trong phần lớn các tác vụ nhưng có chi phí vận hành thấp hơn 40% so với phiên bản Opus tiền nhiệm. Bản cập nhật này cũng mang lại cải tiến về tốc độ và hiệu quả sử dụng token.
OpenAI prepares major announcements for always-on autonomous agents
Cộng đồng công nghệ đang chờ đợi loạt thông báo lớn từ các nhà phát triển về hệ thống agent hoạt động liên tục. Những cải tiến về năng suất và nhân sự mới được kỳ vọng sẽ mang lại bước ngoặt cho khả năng tự động hóa.
Agora-2 and PixVerse R2 introduced as real-time interactive world models
Nền tảng công nghệ ra mắt các mô hình thế giới mới hỗ trợ mô phỏng môi trường và nhân vật theo thời gian thực. Các hệ thống này cho phép nhiều người dùng và tác nhân tương tác trực tiếp trong một không gian chia sẻ.
Performance optimization makes Claude applications three times faster
Nhà phát triển công bố các phương pháp và kỹ thuật tối ưu hóa giúp tăng tốc độ của ứng dụng Claude và giao diện web lên gấp ba lần trong hai tuần. Đội ngũ kỹ thuật đã chia sẻ chi tiết quy trình đo lường, gỡ lỗi và cải thiện hiệu năng hệ thống.
Opus 5.5 released with distillation and reinforcement learning from a teacher model
Mô hình Opus 5.5 được đào tạo thông qua phương pháp học tự cải thiện và chưng cất từ một mô hình giáo viên nội bộ lớn hơn. Phương pháp hậu huấn luyện này tạo ra một mô hình nhỏ gọn hơn, chi phí thấp hơn nhưng đạt hiệu suất thông minh cao.
Imp launches as a DSPy port for the BEAM ecosystem
Imp chính thức ra mắt như một bản chuyển đổi của DSPy sang hệ sinh thái BEAM, mang đến các tính năng lập trình ngôn ngữ tự cải thiện mang tính khai báo bao gồm chữ ký, trình tối ưu hóa và vòng lặp tác nhân.
OpenRouter integrates new language models including Space Bunny Alpha and GPT-6 Sol Luna
Nền tảng OpenRouter tích hợp nhiều mô hình xử lý ngôn ngữ và đa phương thức mới, trong đó có Space Bunny Alpha hỗ trợ cửa sổ ngữ cảnh một triệu token và dòng mô hình GPT-6 từ OpenAI với mức giá dịch vụ mới công bố.
5 tài khoản độc lập36 bài1 bài viết9.639 tương tác
Ollama introduces pay-as-you-go cloud model usage credits
Ollama đã triển khai hệ thống tín dụng sử dụng cho phép người dùng thanh toán theo mức tiêu thụ thực tế đối với các mô hình đám mây, không bắt buộc phải mua gói thuê bao định kỳ. Cùng lúc đó, cộng đồng ghi nhận sự xuất hiện của các mô hình phân loại nhỏ gọn chạy hoàn toàn cục bộ trên phần cứng cá nhân thông qua nền tảng này.
4 tài khoản độc lập16 bài1 lab4.911 tương tác
deepseek r1whisperollamareinforcement learning with verifiable rewardssoraveo
Researchers debate security risks associated with open-source AI models
Một cuộc thảo luận công khai đã diễn ra về mức độ an toàn của các hệ thống AI mã nguồn mở so với các mô hình độc quyền. Các bên tham gia phân tích liệu việc phát hành mã nguồn có làm gia tăng nguy cơ lạm dụng công nghệ cho các cuộc tấn công mạng hay đóng góp vào năng lực phòng thủ chung.
Google DeepMind publishes essay series on agent systems governance and AGI benefits
Google DeepMind đã phát hành các bài tiểu luận nghiên cứu về phương pháp kiểm soát hành vi lệch chuẩn trong các tập thể agent tự trị. Các tác giả cũng đề xuất khung đạo đức nhằm đảm bảo lợi ích từ công nghệ trí tuệ nhân tạo tổng quát được phân phối công bằng trên phạm vi toàn cầu.
Cohere expands Model Vault data security service to the Canadian market
Cohere đã triển khai dịch vụ Model Vault tại Canada, mang đến giải pháp kiểm soát toàn diện với khối lượng công việc tự động mở rộng và cơ sở hạ tầng đơn thuê bao. Dịch vụ này hướng đến việc đảm bảo tính riêng tư dữ liệu và tối ưu hóa tổng chi phí sở hữu cho các tổ chức sở tại.
LangChain integrates parallel processing and launches LangSmith fine-tuning tools
LangChain đã tích hợp cơ chế xử lý song song vào hệ thống quản lý agent của nền tảng. Đồng thời, dịch vụ tinh chỉnh LangSmith cũng ra mắt thông qua sự hợp tác với các đối tác cơ sở hạ tầng nhằm giải quyết bài toán chuyển hóa dữ liệu thô thành môi trường huấn luyện tối ưu.
Alibaba Qwen releases Qwen3.8-Omni-Flash multimodal model for long-horizon agents
Nhóm phát triển Qwen thuộc Alibaba đã giới thiệu mô hình đa phương thức bản địa Qwen3.8-Omni-Flash, được thiết kế chuyên biệt cho các tác vụ agent kéo dài trên văn bản, âm thanh và thị giác. Sự kiện diễn ra song song với việc cộng đồng mã nguồn mở chia sẻ các bộ công cụ và môi trường huấn luyện tăng cường cho agent.
CÂU HỎI — Làm thế nào để giải quyết tình trạng lãng phí GPU và dư thừa quỹ đạo khi huấn luyện tăng cường trực tuyến cho các tác nhân có tầm nhìn siêu dài?
QwenGyre mang lại mức cải thiện tuyệt đối 6.0% trên NL2RepoBench từ 52.5% lên 58.5% trong 48 bước.
CÂU HỎI — Làm thế nào để chuyên biệt hóa định dạng lượng tử hóa cho từng pha prefill và decode của mô hình ngôn ngữ lớn nhằm cải thiện hiệu năng inference?
With released Qwen3.8-27B GGUF decoders, training an NVFP4 prefiller improves 1-bit accuracy by 32.5 points on MMLU-Pro and 35.3 on MMMU-Pro without modifying the decode checkpoint.
CÂU HỎI — Làm thế nào để biểu diễn trạng thái và quá trình thực thi của tác nhân điều khiển dưới dạng mã nhằm cải thiện khả năng tổng quát hóa trong thế giới vật lý?
On RoboCasa365, HexaAnything improves Composite-Unseen and overall success over XR-1 VLA, and its Harness-trained HexaModel beats the base on every split, indicating code traces internalize physical execution.
CÂU HỎI — Làm thế nào để tổng hợp dữ liệu huấn luyện chất lượng cao từ các tài liệu công khai nhằm cải thiện khả năng học tập theo ngữ cảnh (context-dependent reasoning) của LLM mà không cần người gán nhãn?
SFT nâng Qwen3.6-35B-A3B student từ 13.7% lên 22.8% trên CL-bench.
CÂU HỎI — Làm thế nào để khắc phục hiện tượng lệch công cụ giữa con người và tác nhân cũng như hiện tượng tổn hại âm thầm trong các tác nhân chuỗi thời gian?
Một thư viện gồm 21 công cụ do chuyên gia tuyển chọn giúp ích cho một số tác vụ nhưng gây hại cho các tác vụ khác, làm giảm độ chính xác của hiện bất thường dưới mọi mô hình nền tảng được thử nghiệm.
CÂU HỎI — Làm thế nào để loại bỏ các nhãn sai do phương pháp majority vote hoặc model judge tạo ra trong quá trình self-evolution của mô hình thị giác-ngôn ngữ?
24% majority-vote labels và 18% model-judge labels được tạo ra trong quá trình self-evolution là sai.
CÂU HỎI — Làm thế nào để truyền tải năng lực mô hình thông qua văn bản không liên quan đến tác vụ mà không cần dùng target-task examples, teacher logits hay teacher parameters?
Trong thử nghiệm lập trình chính với Qwen2.5-1.5B, 5,664 nses mang lại mức tăng 5.34 pp trên HumanEval+ so với control được khớp nhiễu chính xác.
CÂU HỎI — Làm thế nào để tối ưu hóa việc xếp hạng lại tập tài liệu cho hệ thống RAG và nghiên cứu sâu mà tránh được tình trạng phân bổ tín hiệu thưa thớt?
Across ten benchmarks spanning RAG, deep research, and setwise evaluation, AdaTutoRank attains the best overall performance while issuing fewer retrieval calls.
CÂU HỎI — Làm thế nào để giải quyết hiện tượng sụp đổ trong quá trình chưng cất trực tuyến có sự giám sát tiềm ẩn?
Giám sát tiềm ẩn đơn lẻ nâng độ chính xác trên MATH-500 từ 25 lên 46 trong 10 bước nhưng việc huấn luyện tiếp theo làm giảm hiệu suất xuống 11 mà không thể phục hồi.
CÂU HỎI — Làm thế nào để tự động xây dựng các bộ benchmark đánh giá hành vi tác nhân từ các trace triển khai thực tế?
Experiments in coding and general tool use draw on 252,557 sessions and produce 107 benchmarks with 4,125 instances, fulfilling 95.3% of build-target requests.
CÂU HỎI — Làm thế nào để cân bằng phản hồi từ nhiều mô hình chuyên gia trong quá trình chưng cất trực tuyến đa chuyên gia cho mô hình ngôn ngữ lớn?
On six public benchmarks, DN-MOPD improves the average score over MOPD at every size, across three random seeds and under two answer-length limits, and recovers most of the lost mathematics gain.
CÂU HỎI — Làm thế nào để huấn luyện đồng thời khả năng tự phản ánh (reflection) và tạo ảnh trong một mô hình đa phương thức hợp nhất thông qua học tăng cường?
Trên BAGEL, UMM-Reflection cải thiện GenEval thêm 12.05 điểm so với SFT.
CÂU HỎI — Làm thế nào để mô hình phần thưởng xử lý bản chất đa phương thức của sở thích con người thay vì chỉ đưa ra ước lượng điểm đơn lẻ?
Bài báo giới thiệu DRM (Diffusion Reward Model), một mô hình phần thưởng xem việc tạo phần thưởng là bài toán ước lượng mật độ có điều kiện. Sử dụng một Diffusion Transformer nhẹ kết hợp với bộ mã hóa LLM đóng băng, DRM khử nhiễu Gaussian thành một vectơ phần thưởng, qua đó bảo toàn cấu trúc đa phương thức của dữ liệu sở thích mà không cần giả định tham số cố định. Thử nghiệm trên năm benchmark cho thấy DRM đạt hoặc vượt qua các baseline, duy trì sự cạnh tranh với các mô hình lớn hơn và mang lại hiệu suất chính sách tốt hơn trong các thí nghiệm RLHF hạ lưu.
CÂU HỎI — Các kết nối tắt ảnh hưởng như thế nào đến khả năng chuyển đổi chiều sâu kiến trúc thành chiều sâu tính toán hiệu quả trong các mô hình Transformer?
Các biến thể chuẩn hóa Pre-LN tiêu chuẩn mang lại ít lợi ích và có thể làm giảm hiệu suất khi mô hình trở nên sâu hơn và hẹp hơn.
CÂU HỎI — Liệu có thể giữ nguyên toàn bộ visual token trong MLLM mà vẫn giảm được chi phí tính toán khi Transformer xử lý lặp lại các biểu diễn hình ảnh hay không?
Khôi phục chỉ một vài hướng sau khi chặn attention giữa hình ảnh và văn bản giúp thu hồi phần lớn độ chính xác bị mất.
CÂU HỎI — Làm thế nào để xây dựng phương pháp pre-training tự giám sát (self-supervised) hiệu quả cho các cảm biến xúc giác phân tán có bố cục thưa thớt và bất thường?
Tactile-JEPA giảm force estimation error đi 6.3% so với prior state-of-the-art.
CÂU HỎI — Làm thế nào để đánh giá chính xác hành vi tham gia hội thoại, giữ im lặng và ngắt lời của trợ lý giọng nói trong môi trường đa người dùng dạng full-duplex?
MiniCPM-o 4.5 dẫn đầu trên 3 năng lực được chấm điểm trong số 5 hệ thống thoại open-weight được đánh giá.
CÂU HỎI — Làm thế nào để tạo ra chuyển động khuôn mặt phản hồi theo thời gian thực cho các hệ thống đàm thoại có thể hiện thân trong môi trường vật lý?
REALM cải thiện các mô hình cơ sở đã đánh giá trên nhiều chỉ số chất lượng chuyển động dựa trên ViCo và L2L.
CÂU HỎI — Làm thế nào để duy trì tính nhất quán dài hạn và khả năng phản hồi thời gian thực trong các mô hình thế giới tương tác?
Bài báo giới thiệu WorldPlay2, một mô hình thế giới tương tác giải quyết thách thức quản lý các điều khiển không đồng nhất và chi phí ngữ cảnh cao trong quá trình huấn luyện. Hệ thống kết hợp giao diện điều khiển kết hợp nhân tử, bộ nhớ nén được chia sẻ giữa sinh viên tự hồi quy và giáo viên song hướng, cùng chiến lược Stable Forcing để khởi tạo và chạy lại toàn bộ quá trình. Kết quả là mô hình đạt được hiệu suất vượt trội và khả năng tổng quát hóa mạnh mẽ so với các phương pháp hiện tại.