Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Tổng hợp trong ngàydo mô hình viết
01ChatGPT tích hợp vào trợ lý DevinNền tảng Devin cho phép người dùng đăng nhập bằng gói thuê bao ChatGPT. Khả năng này xuất hiện bên cạnh việc mở rộng nền tảng plugin của ChatGPT.→ 0103
02OpenAI chuẩn bị ra mắt agent tự độngOpenAI chuẩn bị giới thiệu các agent hoạt động liên tục tại sự kiện DevDay. Sự kiện này cũng trưng bày nhiều sản phẩm và cập nhật nền tảng mới.→ 1219
03Anthropic ra mắt dòng Claude Sonnet 5.5Anthropic phát hành Claude Sonnet 5.5 với tốc độ nhanh và chi phí thấp hơn, đồng thời mở rộng dòng sản phẩm với phiên bản Haiku 5.5.→ 04
Video trong ngày
cuộn số 5 · 1:18
NHÃNarchitecture · 21 tiếng nói
OpenAI phát hành GPT-6.1 và khắc phục lỗi thị giác trên dòng mô hình GPT-6
OpenAI phát hành GPT-6.1 trên các gói trả phí và qua API, đồng thời khắc phục lỗi làm suy giảm khả năng hiểu hình ảnh trên các mô hình GPT-6 Sol và GPT-6 Luna.
ChatGPT expands its plugin platform and team collaboration features
ChatGPT cho phép người dùng xây dựng các ứng dụng gốc bằng phần mở rộng plugin và đưa các đề xuất plugin trực tiếp vào trong cuộc trò chuyện. Nền tảng này cũng ra mắt ChatGPT Space, một không gian cộng tác ghi chép có trực quan hóa dữ liệu theo thời gian thực.
Google launches Gemini 4 Argon and Gemini 3.8 Flash TTS audio models
Google ra mắt Gemini 4 Argon, mô hình hướng đến các tác vụ kỹ thuật phần mềm, công việc tri thức và an ninh mạng với giới hạn đầu ra đạt 1 triệu token. Đồng thời, hãng cũng giới thiệu hai mô hình âm thanh mới là Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS.
Cognition crosses $1B revenue run rate and integrates ChatGPT into Devin
Cognition đạt mốc doanh thu định hướng hàng năm là 1 tỷ USD. Đồng thời, nền tảng trợ lý lập trình Devin chính thức cho phép người dùng đăng nhập trực tiếp bằng gói thuê bao ChatGPT Plus hoặc Pro.
Anthropic releases Claude Sonnet 5.5 with improved speed and efficiency
Anthropic ra mắt Claude Sonnet 5.5 với tốc độ xử lý nhanh hơn 30% và chi phí thấp hơn tới 30% so với phiên bản trước. Mô hình này giúp tối ưu hóa hiệu suất khi thực hiện các tác vụ lập trình và sửa lỗi.
OpenAI releases GPT-6.1 and patches vision bugs across GPT-6 models
OpenAI phát hành GPT-6.1 trên các gói trả phí và qua API, đồng thời khắc phục lỗi làm suy giảm khả năng hiểu hình ảnh trên các mô hình GPT-6 Sol và GPT-6 Luna.
NVIDIA Introduces Open Agent Safety Platform Combining OpenShell and Sentry
NVIDIA vừa ra mắt Open Agent Safety Platform cùng với các công cụ OpenShell và Sentry nhằm tăng cường bảo mật cho AI agent. Nền tảng này giúp duy trì các chính sách an toàn và kiểm soát sandbox trong suốt quá trình agent thực hiện tác vụ tự động kéo dài.
Grok Bot Updates With Financial Management and Software Development Support
Grok Bot đã được bổ sung các tính năng nâng cao phục vụ việc xây dựng phần mềm, bao gồm khả năng chuyển giao tác vụ lập trình cho Cursor, quản lý pull request qua các plugin GitHub và Origin. Ngoài ra, hệ thống cũng hỗ trợ các công việc tài chính.
OpenAI Launches GPT-6.1 Sol Model Focused on Cost Efficiency
OpenAI đã công bố mô hình GPT-6.1 Sol với mức giá kinh tế kết hợp hiệu suất cao trong các bài kiểm tra lập trình web. Mô hình này được đưa vào thử nghiệm trên bảng xếp hạng Arena ở chế độ Battle và Agent.
Anthropic Launches New Developer Portal for Claude Builders
Anthropic đã khai trương trang web mới dành riêng cho các nhà phát triển xây dựng ứng dụng với Claude. Nền tảng này cung cấp các bài viết chuyên sâu về kỹ thuật, hướng dẫn sử dụng API, tài liệu Claude Code và kinh nghiệm thực tế từ đội ngũ phát triển.
Meta Continues Expanding Muse Product Line and Personal Assistant Features
Meta đã phát hành hàng loạt bản cập nhật cho hệ sinh thái Muse trong sáu tháng qua, bao gồm Muse Spark, các công cụ xử lý hình ảnh, video, âm thanh và mã nguồn. Các dòng sản phẩm này hướng tới việc cung cấp trải nghiệm trợ lý cá nhân tích hợp trên các thiết bị.
OpenAI prepares to launch always-on agents at DevDay
OpenAI chuẩn bị tổ chức sự kiện DevDay, nơi giới thiệu các dòng agent hoạt động liên tục mới tích hợp trong các gói chuyên nghiệp. Các agent này được thiết kế để hoạt động tự động và liên tục nhằm hỗ trợ người dùng. Sự kiện diễn ra sau chuỗi ngày chuẩn bị và hé lộ thông tin từ nhà phát triển.
Platforms release new models and ultrafast token generation speeds
Nhiều nền tảng đã công bố các mô hình mới cùng các gói tốc độ cao mang lại khả năng tạo token vượt trội. Các mô hình như Gemini 3.8 Flash, GPT-6 Luna (Max) và TwIL-LM3-Pro đạt hiệu suất cao với tốc độ lên đến hàng trăm token mỗi giây và Context lớn. Các hệ thống này cung cấp tùy chọn miễn phí và trả phí nhằm đáp ứng nhu cầu ngày càng tăng của người dùng.
OpenRouter integrates specialized decision models for coding agents
OpenRouter đã bổ sung các mô hình quyết định như d1 và Kev 4B vào hệ thống nhằm phục vụ các tác vụ phân loại, định tuyến và kiểm duyệt. Các mô hình này cung cấp khả năng xử lý ngữ cảnh linh hoạt với chi phí thấp cho lập trình viên. Coding agent có thể tích hợp trực tiếp các mô hình này thông qua Decisions API để tối ưu hóa quy trình làm việc.
Expansion of Model Context Protocol integration across ChatGPT and Claude
Cả ChatGPT và Claude đều công bố các tính năng mới hỗ trợ Model Context Protocol (MCP) nhằm đơn giản hóa việc xây dựng và quản lý plugin. ChatGPT Sites giờ đây có thể lưu trữ các MCP server và mở rộng plugin trực tiếp. Trong khi đó, một cổng thông tin mới được thiết kế để các nhà phát triển gửi plugin và theo dõi mức độ sử dụng trên Claude.
Claude Opus 5.5 improves accuracy and reduces hallucination rates
Phiên bản Claude Opus 5.5 ghi nhận những cải thiện đáng kể về độ chính xác và tốc độ xử lý so với các thế hệ trước. Mô hình này đạt điểm số cao trong các bài đánh giá chuẩn như Drone-Bench với tỷ lệ gian lận thấp hơn. Đồng thời, các công cụ tích hợp như Claude Tag cũng được mở rộng khả năng kết nối dữ liệu cá nhân trên nhiều nền tảng làm việc.
World Labs introduces the Agora-2 multi-agent world model
World Labs công bố Agora-2, mô hình thế giới đa tác nhân thế hệ mới hỗ trợ tương tác đồng thời giữa tối đa 20 con người và agent trong một môi trường chia sẻ theo thời gian thực. Bên cạnh đó, lĩnh vực nghiên cứu mô hình thế giới cũng đón nhận sự tham gia của các chuyên gia hàng đầu như Jürgen Schmidhuber trong vai trò cố vấn khoa học cho Sakana AI.
Ollama adds local execution support for decision models
Ollama chính thức bổ sung khả năng chạy cục bộ cho các mô hình quyết định như Nimble và các biến thể Tev1 dung lượng nhỏ. Các mô hình này cho phép người dùng xử lý các tác vụ như phân loại, định tuyến và kiểm duyệt hoàn toàn trên thiết bị cá nhân với độ trễ thấp. Bản cập nhật mang lại giải pháp thay thế hiệu quả cho các ứng dụng yêu cầu tính bảo mật cao.
Recap of major announcements and product launches at OpenAI DevDay
Sự kiện OpenAI DevDay chính thức diễn ra với nhiều thông báo quan trọng và loạt sản phẩm mới được giới thiệu trên sân khấu. Cộng đồng công nghệ theo dõi sát sao các bản cập nhật và chi tiết kỹ thuật được công bố trong khuôn khổ chương trình.
Inquiry into reasoning extraction campaign and orbital TPU test mission
Dữ liệu ghi nhận một chiến dịch nhằm trích xuất các mô hình suy luận ẩn, với các cá nhân liên quan đến nhà phát triển Moonshot AI nằm trong tâm điểm điều tra. Song song với đó, các kỹ sư tiến hành phóng một vệ tinh thử nghiệm để đánh giá khả năng hoạt động của bộ xử lý tensor Google TPU trong không gian.
DSPy releases version 3.4.0 with native System One support and new optimizer
Phiên bản DSPy 3.4.0 chính thức ra mắt với khả năng hỗ trợ nguyên bản cho các mô hình System One và tích hợp bộ tối ưu hóa ReAnchor mới. Bản cập nhật này mở rộng khả năng lập trình mô hình ngôn ngữ mang tính khai báo cho các hệ thống tùy chỉnh.
Google DeepMind publishes new essays on AGI trajectory and agent swarms
Google DeepMind phát hành ba tiểu luận mới phân tích cách kiểm soát hành vi trong các mạng lưới tác nhân tự động và định hình quá trình chuyển đổi sang trí tuệ nhân tạo tổng quát. Các nghiên cứu cũng dự báo mức độ bùng nổ về số lượng token mà các tác nhân sử dụng trong thập kỷ tới.
MiMo-V2.6 update fixes tool-call repetition while new stealth models appear
Bản cập nhật dòng mô hình MiMo-V2.6 đã khắc phục thành công sự cố lặp lại lệnh gọi công cụ gây lãng phí ngữ cảnh. Đồng thời, nền tảng OpenCode bổ sung các tùy chọn mô hình mới hỗ trợ ngữ cảnh dài và khả năng xử lý đa phương thức.
Discussion on the capabilities of Europe's frontier AI labs and Mistral AI
Cộng đồng công nghệ thảo luận về năng lực cạnh tranh của các phòng thí nghiệm AI tại châu Âu và chiến lược phát triển mô hình của Mistral AI. Các ý kiến xoay quanh việc liệu khu vực này có duy trì được các dự án nghiên cứu đạt chuẩn biên giới hay không.
LangChain integrates Parallel and launches the LangSmith fine-tuning tool
LangChain tích hợp tính năng Parallel vào các tác nhân được quản lý và ra mắt công cụ tinh chỉnh LangSmith hợp tác với Baseten cùng Fireworks AI. Bản cập nhật hướng đến việc xử lý dữ liệu và tối ưu hóa các quỹ đạo tương tác trong hệ thống tác nhân.
CÂU HỎI — Dữ liệu huấn luyện dài hạn mang tính phản chiếu (long-horizon reflective data) có giúp cải thiện khả năng tự tinh chỉnh của agent LLM qua nhiều vòng lặp không?
Agent đạt 81.8 trên MLE-bench Lite và 70.7 trên Frontier-CS.
CÂU HỎI — Làm thế nào để tổng quát hóa các tác vụ bất đồng bộ thành các agent LLM tổng quát có khả năng xử lý đồng thời mà không cần huấn luyện riêng cho từng tác vụ?
Framework hỗ trợ định nghĩa các inference coroutine với các memory state chồng chéo.
CÂU HỎI — Làm thế nào để một mô hình Builder học hỏi từ phản hồi thực thi nhằm xây dựng môi trường môi trường thực thi và harness tốt hơn cho mô hình Target trong bối cảnh test-time AI4AI?
Full-bank meta-skills cải thiện macro-average performance thêm 8.95 điểm phần trăm so với không dùng kỹ năng.
CÂU HỎI — Nguyên nhân nào từ mô hình đánh giá (critic) gây ra sự bất ổn định trong quá trình tối ưu hóa chính sách cận biên (PPO) cho mô hình ngôn ngữ lớn?
Điểm xác thực tốt nhất của EasyPPO đạt mức cải thiện tương đối là 14.89% trên FrontierCS so với PPO.
CÂU HỎI — Làm thế nào để kết hợp đồng tiến hóa giữa tìm kiếm web và giải quyết tác vụ nhằm khắc phục hiện tượng đình trệ của quá trình tìm kiếm tiến hóa dựa trên LLM?
EvoDuet nâng normalized discovery gain của OpenEvolve từ 74.1% lên 78.0% với GPT-5.6-Luna.
CÂU HỎI — Làm thế nào để cải thiện các mô hình đa phương thức thông qua quá trình tự phản hồi trong thời gian suy luận mà không cần giáo viên bên ngoài?
UniEvo-VL cải thiện hiệu suất tạo hình ảnh của mô hình đa phương thức mà không cần giáo viên bên ngoài.
CÂU HỎI — Làm thế nào để khai thác kiến thức thế giới đã có sẵn trong LLM phục vụ cho việc ra quyết định chuyển giao môi trường mà không cần mô hình thế giới bổ sung?
EVOKE cải thiện hiệu năng tác vụ và khả năng tổng quát hóa vào các môi trường chưa từng thấy.
CÂU HỎI — Làm thế nào để xây dựng một mô hình Hệ thống Một (System One) chuyên biệt cho các tác vụ tiếng Trung đạt tốc độ cao và độ chính xác phân loại tốt?
Sau tiền huấn luyện giai đoạn đầu, Chinese-Jev vượt độ chính xác của Jev gốc 1.24% trên tác vụ miền chung với tốc độ nhanh hơn 20.3x.