Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Video trong ngày
cuộn số 7 · 1:05
NHÃNinference · 23 tiếng nói
Claude Sonnet 5.5 ra mắt với tốc độ nhanh hơn 30% và cơ chế bảo mật phân vùng
Claude Sonnet 5.5 chính thức ra mắt, nhanh hơn 30% và tiết kiệm chi phí hơn so với thế hệ trước. Bản cập nhật này cũng áp dụng cơ chế giữ nguyên vùng suy nghĩ nhằm ngăn chặn các cuộc tấn công trích xuất dữ liệu giữa các tài khoản.
Google releases Gemini 4 Argon with a 1M token output limit
Google ra mắt mô hình Gemini 4 Argon, mang lại hiệu năng cao trong các tác vụ kỹ thuật phần mềm dài hạn và an ninh mạng. Hệ thống sở hữu giới hạn đầu ra 1 triệu token và đạt chi phí cạnh tranh trên các bảng xếp hạng đánh giá.
Claude Code adds support for custom mods and UI modifications
Claude Code cho phép người dùng tùy chỉnh giao diện, thay đổi hành vi và tích hợp tính năng mới thông qua các plugin viết bằng TypeScript. Bản cập nhật cũng bổ sung các công cụ hỗ trợ xây dựng đánh giá để tối ưu hóa ứng dụng.
ChatGPT opens its platform allowing users to build native plugin apps
Nền tảng ChatGPT mở rộng hỗ trợ cho phép người dùng xây dựng và tích hợp các ứng dụng plugin gốc ngay trong cuộc trò chuyện. Tính năng này hướng tới việc tiếp cận lượng lớn người dùng hàng tuần của dịch vụ.
Codex adds premium speed tiers and cloud environments
Codex triển khai tầng tốc độ cao cấp Ultrafast giúp tăng tốc độ sinh token đáng kể trong API và môi trường lập trình. Bản cập nhật cũng giới thiệu các môi trường đám mây có thể tái sử dụng để chạy tác nhân tự động.
Nền tảng Devin cho phép người dùng đăng nhập bằng gói ChatGPT Plus hoặc Pro để trừ trực tiếp hạn mức sử dụng. Đồng thời, nhà phát triển cũng công bố các bản cập nhật giúp giảm chi phí vận hành cho các mức giá khác nhau.
ChatGPT Sites adds support for hosting and deploying MCP servers
ChatGPT Sites bổ sung tính năng lưu trữ và triển khai trực tiếp các máy chủ Model Context Protocol kèm theo tiện ích mở rộng. Bản cập nhật giúp người dùng dễ dàng tạo lập và chia sẻ các công cụ kết nối dữ liệu.
Muse faces privacy backlash over user data leaks and releases open-source hardware firmware
Ứng dụng Muse vấp phải chỉ trích gay gắt về bảo mật sau khi tiết lộ thông tin nhạy cảm của người dùng. Cùng lúc đó, dự án đã công bố firmware mã nguồn mở ESP32 và SDK Linux để hỗ trợ phát triển phần cứng tương thích.
Claude Sonnet 5.5 releases with 30% faster speed and isolated context thinking
Claude Sonnet 5.5 chính thức ra mắt, nhanh hơn 30% và tiết kiệm chi phí hơn so với thế hệ trước. Bản cập nhật này cũng áp dụng cơ chế giữ nguyên vùng suy nghĩ nhằm ngăn chặn các cuộc tấn công trích xuất dữ liệu giữa các tài khoản.
Performance evaluations of Claude 5.5 and Fable 5.5 reveal reduced hallucination rates
Các thử nghiệm benchmark cho thấy Opus 5.5 giảm thiểu tình trạng suy luận sai lệch so với các phiên bản tiền nhiệm. Trong khi đó, người dùng ghi nhận các truy vấn đang bắt đầu được định tuyến sang Fable 5.5 với kết quả vượt trội.
Anthropic files for IPO, revealing 1,088% revenue growth and surging compute costs
Anthropic đã nộp hồ sơ xin phát hành cổ phiếu lần đầu ra công chúng, báo cáo doanh thu năm tài chính đạt 4,59 tỷ USD, tăng 1.088% so với năm trước. Sự tăng trưởng này đi kèm với chi phí hạ tầng điện toán tăng cao.
Anthropic launches new developer portal for engineering guides and resources
Anthropic chính thức khai trương trang web dành cho nhà phát triển xây dựng ứng dụng với Claude, cung cấp các bài viết chuyên sâu về kỹ thuật và hướng dẫn sử dụng API. Sonnet 5.5 cũng được chọn làm mô hình vận hành gói miễn phí.
NVIDIA introduces Open Agent Safety Platform to secure AI agent execution
NVIDIA hợp tác với hơn 100 đối tác trong ngành ra mắt Open Agent Safety Platform, bao gồm hai thành phần OpenShell và Sentry. Nền tảng này cung cấp môi trường chạy bảo mật với các ranh giới rõ ràng cho các tác nhân tự trị.
OpenAI introduces Dots, autonomous 24/7 AI agents operating across applications
OpenAI phát hành Dots, hệ thống tác nhân trí tuệ nhân tạo hoạt động liên tục trên môi trường máy tính ảo và trình duyệt. Các tác nhân này được thiết kế để tự động xử lý các tác vụ phức tạp và tích hợp với hàng nghìn ứng dụng.
OpenAI develops assistant competing with existing bot offerings
OpenAI sắp ra mắt sản phẩm mới có tên là Dots, hoạt động như một trợ lý ảo tích hợp quyền truy cập vào toàn bộ các đoạn bộ nhớ của ChatGPT và sẵn sàng hoạt động liên tục 24/7.
Fireworks Research releases Ember-1 built on Kimi K3
Fireworks Research đã phát triển Ember-1 dựa trên nền tảng mô hình Kimi K3. Mô hình này được huấn luyện hậu kỳ để tư duy ít lặp lại hơn, giúp tiết kiệm khoảng 40% token trong khi vẫn duy trì hiệu suất tương đương trên các bài kiểm tra chuẩn.
OpenAI modifies usage calculation for the $200 Pro subscription
OpenAI mở cửa trở lại các gói thuê bao Pro giá 200 USD cho người dùng mới đồng thời thay đổi phương thức tính hạn mức sử dụng. Theo đó, lượng hạn mức quy đổi theo giá trị API sẽ giảm một nửa đối với cấp độ thuê bao này.
Qwen3.8-27B optimized for multimodal decision-making tasks
Mô hình Qwen3.8-27B đã được chuyển đổi thành mô hình quyết định đa phương thức với thời gian phản hồi dưới 100 ms dựa trên trạng thái trò chơi trực tiếp. Mô hình này hiện có thể truy cập thông qua nền tảng Nebius để phục vụ các tác vụ xây dựng tác trợ lý và nghiên cứu chuyên sâu.
OpenRouter đã tích hợp phiên bản Pareto 26.10 Preview với mức giá 0,80 USD cho mỗi triệu token đầu vào và 3,20 USD cho mỗi triệu token đầu ra. Đây là một mô hình tổng hợp đa phương thức hỗ trợ cho nghiên cứu, lập trình và các quy trình tác vụ tự động.
Llama.cpp adds local support for decision models through the /v1/systemone endpoint
Llama.cpp đã bổ sung hỗ trợ cho các mô hình quyết định thông qua endpoint /v1/systemone. Người dùng hiện có thể chạy các mô hình quyết định cục bộ một cách hiệu quả và riêng tư ngay trên thiết bị.
OpenAI teases always-on agent capabilities for upcoming DevDay event
OpenAI đã hé lộ sự xuất hiện của các tác vụ tự động luôn bật dành cho người dùng chuyên nghiệp trước thềm sự kiện DevDay. Tính năng này được thiết kế để hoạt động liên tục như các trợ lý thông minh.
World Labs joins the AMD ecosystem to develop world models
World Labs đã gia nhập hệ sinh thái AMD để kết hợp chuyên môn về mô hình thế giới và trí tuệ nhân tạo. Sự hợp tác này tập trung vào việc thúc đẩy nghiên cứu và phát triển các mô hình nền tảng thế giới cho trí tuệ nhân tạo vật lý.
Cohere launches the Embed 5 embedding model family
Cohere đã giới thiệu Embed 5, dòng mô hình nhúng mới bao gồm phiên bản hiệu suất cao Embed 5 Pro và phiên bản độ trễ thấp Embed 5 Fast. Bản phát hành này mang lại năng lực tiên tiến cho các ứng dụng tìm kiếm và xử lý ngôn ngữ.
LangChain releases updates for Deep Agents and MCP adapters
LangChain đã phát hành phiên bản mcp-adapters 2.0 hỗ trợ phiên bản Model Context Protocol không trạng thái mới nhất cho các tác nhân TypeScript. Đồng thời, nền tảng này cũng cập nhật khóa học LangChain Academy để giới thiệu Deep Agents và Managed Deep Agents nhằm đơn giản hóa việc triển khai.
CÂU HỎI — Làm thế nào để kết hợp giao diện đồ họa GUI và dòng lệnh CLI nhằm nâng cao hiệu suất cho agent máy tính?
HybridCUA-9B achieves 53.6% accuracy on OSWorld, improving over the base model by 14.8 percentage points, and improves performance on WindowsAgentArena by 4.0 percentage points.
CÂU HỎI — Làm thế nào để trích xuất và tích hợp trực tiếp các quy trình con tái sử dụng từ dữ liệu hành động phẳng vào trọng số mô hình để cải thiện khả năng tổng quát hóa của tác nhân đa bước mà không cần gọi LLM?
X-Tree cải thiện tỷ lệ thành công lên tới 4.5% SR trên WebArena.
CÂU HỎI — Làm thế nào để tiến hóa chương trình phần thưởng tại thời điểm chạy nhằm tái sử dụng kỹ năng điều khiển robot hình người mà không cần huấn luyện lại?
InterEvolve leverages an object-aware forward-backward behavioral foundation model to map rewards into loco-manipulation behaviors at test time.
CÂU HỎI — Liệu các agent phần mềm có thể hoàn thành các tác vụ kỹ thuật khi thông tin vận hành chỉ có sẵn qua giao diện trực quan của ứng dụng đang chạy hay không?
CUA-SWE cung cấp một môi trường thử nghiệm thống nhất trên bốn lĩnh vực kỹ thuật phần mềm.
CÂU HỎI — GPT-6 Astra thể hiện năng lực và hạn chế như thế nào khi đóng vai trò là chính sách hiện thân (embodied policies) trực tiếp điều khiển robot qua các tác vụ khác nhau?
Hybrid control với π0.5 đạt 48% success trên RoboDojo subset.
CÂU HỎI — Kiến trúc chú ý nào có thể giải quyết tình trạng bão hòa bộ nhớ KV cache và độ phức tạp tính toán trong mô hình thế giới video?
WorldAttention consistently surpasses prior state-of-the-art methods, achieving subject consistency scores of 0.9472 on VBench-Long and 0.9668 on InterVBench, respectively.
CÂU HỎI — Làm thế nào để tự động hóa quá trình phát triển game bằng agent thông qua cơ chế tự cải thiện đệ quy?
Notably, experience internalization enables Qwen3.8-27B to reach 61.38 on Godot and 58.53 on Phaser, exceeding GPT-5.5 one-shot scores while reducing Qwen's generation tokens by 11 times.
CÂU HỎI — Làm thế nào để mở rộng mô hình embedding văn bản sang nhiều modality khác mà không làm suy giảm chất lượng retrieval văn bản hoặc cần hàng tỷ tham số?
Omni-Embed-Mini-0.9B đạt 49.57 nDCG@10 trên MTEB-v2 BEIR-8.
CÂU HỎI — Làm thế nào để ngăn chặn các phần thưởng có quy mô lớn làm lu mờ tín hiệu từ các phần thưởng có quy mô nhỏ hơn trong quá trình tối ưu hóa chính sách dựa trên nhóm (GRPO) với nhiều phần thưởng?
CorrGRPO chuyển đổi các hiệp phương sai theo cặp thành hệ số tương quan Pearson để cân bằng ảnh hưởng của các phần thưởng có quy mô khác nhau.
CÂU HỎI — Làm thế nào để sắp xếp danh mục sản phẩm và điều chỉnh LLM thông qua huấn luyện sau để cải thiện độ chính xác tìm kiếm trên ngữ cảnh dài cho các doanh nghiệp nhỏ?
Việc quản lý ngữ cảnh mang lại mức tăng độ chính xác tìm kiếm lên tới 31.4 điểm phần trăm.
CÂU HỎI — Làm thế nào để đánh giá các tác nhân khoa học dữ liệu và phân tích doanh nghiệp trên các quy mô lớn đòi hỏi phải điều hướng cơ sở dữ liệu phức tạp và thực hiện các hành động thực tế?
Argo-Bench mô phỏng nền tảng giao đồ ăn tại Thành phố New York với 81 triệu đơn hàng trong năm 2024.
CÂU HỎI — Làm thế nào để cách ly và đánh giá một cách có hệ thống khả năng hiểu, thao túng và cải thiện dữ liệu huấn luyện của các AI agent?
Bài báo giới thiệu AutoDataBench, một môi trường kiểm thử có kiểm soát nhằm đánh giá Trí tuệ Dữ liệu của các AI agent. Khung này tập trung vào chẩn đoán, tổ chức và xây dựng dữ liệu thông qua ba nhiệm vụ tối ưu hóa được tuyển chọn kỹ lưỡng trong khi giữ nguyên các yếu tố phi dữ liệu. Công cụ này kiểm tra khả năng cải thiện dữ liệu huấn luyện của các LLM thông qua thử nghiệm lặp đi lặp lại dưới các ngân sách tài nguyên cụ thể, đồng thời cung cấp các quỹ đạo giúp cải thiện hiệu suất lập trình trong quá trình huấn luyện trung gian.
CÂU HỎI — Làm thế nào để tận dụng đồng thời các mô hình dự đoán cấu trúc dày đặc (dense prediction) làm mục tiêu căn chỉnh cho khuếch tán pixel mà không gây xung đột gradient?
PixelDense nâng PixelGen-XXL GenEval Overall từ 0.7927 lên 0.8093.
CÂU HỎI — Cấu trúc tham số nào trong các mô hình vision-language-action chịu trách nhiệm cho các cải thiện hiệu suất khi hậu huấn luyện bằng reinforcement learning?
RL tạo ra các cập nhật tham số hạng thấp tập trung vào Timestep Modules của action expert.
CÂU HỎI — Làm thế nào để thực hiện distillation cho các mô hình khuếch tán video một lần duy nhất thành các adapter tái sử dụng được trên nhiều downstream model khác nhau?
LongLive-Plug học các khả năng tái sử dụng dưới dạng LoRAs trên một base model để triển khai plug-and-play.
CÂU HỎI — Làm thế nào để tận dụng các trạng thái trung gian từ các vòng lặp đệ quy trong Transformer để cải thiện chất lượng giải mã mà không cần huấn luyện thêm?
LoopCD-Logits nâng độ chính xác pass@1 trên AIME 2024 của Ouro-2.6B-Thinking từ 61.88% lên 73.33%.
CÂU HỎI — Làm thế nào để áp dụng học tự giám sát trên luồng video liên tục theo thời gian thực mà không làm giảm chất lượng mô hình so với việc lấy mẫu độc lập truyền thống?
WT++ là một 95-hour urban walking-tour video dataset được xây dựng để streaming pretraining.
CÂU HỎI — Liệu kiến thức bố trí chuyên nghiệp có thể được học từ các bản vẽ sàn thực tế bằng cách sử dụng mô hình được huấn luyện trước để tạo ra bố cục có nhận thức về ràng buộc mà không cần suy luận tác nhân lặp đi lặp lại tốn kém không?
AntPlan bao gồm 505 bản vẽ sàn kiến trúc chuyên nghiệp thực tế với các chú thích đồ nội thất dày đặc trải rộng trên 92 lớp đối tượng và mười danh mục phòng dân dụng.