Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Tổng hợp trong ngàydo mô hình viết
01Mở rộng hệ sinh thái plugin AIClaude Code và ChatGPT đều mở rộng hỗ trợ plugin, cho phép người dùng tùy biến hành vi của trợ lý và các nhà phát triển tích hợp thêm tính năng mới.→ 0104
02Mở rộng tiếp nhận giao thức MCPChatGPT hiện cho phép lưu trữ trực tiếp các máy chủ MCP, trong khi LangChain phát hành bộ điều hợp giúp kết nối các tác nhân TypeScript với giao thức này.→ 0627
03Ưu tiên tối ưu hóa chi phíGPT-6.1 Sol của OpenAI và Claude Sonnet 5.5 của Anthropic đều chú trọng tính kinh tế, đem lại hiệu suất cao cùng chi phí vận hành thấp hơn.→ 1020
Video trong ngày
cuộn số 8 · 0:52
NHÃNarchitecture · 24 tiếng nói
Google ra mắt mô hình Gemini 4 Argon cho tác vụ kỹ thuật phần mềm phức tạp
Google ra mắt mô hình Gemini 4 Argon hướng đến các quy trình làm việc phức tạp trong kỹ thuật phần mềm, công việc tri thức và an ninh mạng. Mô hình này sở hữu giới hạn đầu ra 1 triệu token và được định giá 2 USD.
Claude Code introduces support for UI and behavior customization via plugins
Claude Code bổ sung hệ thống plugin cho phép người dùng tùy chỉnh giao diện, thay đổi hành vi và tích hợp các tính năng tự phát triển. Nền tảng cũng cung cấp khả năng tự động xây dựng các bài đánh giá để tối ưu hóa ứng dụng.
Google launches Gemini 4 Argon model for complex software engineering tasks
Google ra mắt mô hình Gemini 4 Argon hướng đến các quy trình làm việc phức tạp trong kỹ thuật phần mềm, công việc tri thức và an ninh mạng. Mô hình này sở hữu giới hạn đầu ra 1 triệu token và được định giá 2 USD.
Codex adds high-speed tier and cloud environments for programming tasks
Codex triển khai gói tốc độ cao Ultrafast với tốc độ tạo token đạt tới 300 token mỗi giây, cùng với các môi trường đám mây tái sử dụng giúp tự động hóa quá trình lập trình. Nền tảng cũng nâng cấp tính năng bảo mật để quét toàn bộ kho lưu trữ GitHub.
ChatGPT expands its plugin system and integrates new automation features
Hệ sinh thái ChatGPT ghi nhận sự tăng trưởng mạnh mẽ nhờ việc tích hợp hệ thống đề xuất plugin trực tiếp trong các cuộc trò chuyện. Các nhà phát triển đang tận dụng nền tảng này để xây dựng thêm nhiều ứng dụng tiện ích cho lượng người dùng lớn hàng tuần.
Muse AI launches open-source hardware tools and real-time speech transcription model
Muse AI công bố dòng phần cứng nguồn mở Muse Gadgets tích hợp vi điều khiển ESP32 và SDK Linux. Đồng thời, nền tảng này cũng giới thiệu một mô hình phiên âm thời gian thực mới.
ChatGPT platform adds capability to host and deploy MCP servers
Nền tảng ChatGPT cho phép người dùng xây dựng, lưu trữ và triển khai trực tiếp các máy chủ Model Context Protocol (MCP) thông qua tính năng tạo trang web. Các bản cập nhật cũng mở rộng khả năng kết nối MCP cho các công cụ phát triển phần mềm và cơ sở dữ liệu.
Devin integrates ChatGPT Plus/Pro subscriptions and slashes prices by up to 70%
Devin cho phép người dùng đăng nhập bằng gói ChatGPT Plus hoặc Pro để trừ trực tiếp vào hạn mức sử dụng mô hình OpenAI. Nền tảng này đồng thời triển khai bản beta cho ứng dụng di động và giảm giá từ 15% đến 70% tùy theo từng gói dịch vụ.
Anthropic holds closed-door theological meetings and advances model roadmap
Anthropic đã mời một tu sĩ trường phái Vedanta đến tổng hành dinh tại San Francisco để tham gia cuộc họp kín có ký thỏa thuận bảo mật cùng các chuyên gia tâm lý và thần học. Các tài liệu hệ thống cho thấy những thay đổi về cách xử lý từ ngữ của mô hình.
Fireworks AI introduces Ember-1 built on Kimi K3 with reduced token usage
Nhóm nghiên cứu tại Fireworks đã phát triển Ember-1 dựa trên nền tảng Kimi K3, đạt hiệu suất chuẩn tương đương nhưng sử dụng ít hơn khoảng 40% số lượng token. Cải tiến này thực hiện thông qua giai đoạn hậu huấn luyện để giảm thiểu tình trạng suy luận lặp lại.
Anthropic launches Sonnet 5.5 model family and extends thinking persistence
Anthropic chính thức phát hành Claude Sonnet 5.5 trên toàn cầu và thông báo dòng Claude Haiku 5.5 sẽ ra mắt trong những tuần tới. Bản cập nhật mở rộng cơ chế bảo toàn luồng suy nghĩ nhằm ngăn chặn các cuộc tấn công trích xuất thông qua việc chuyển đổi tài khoản.
Gemini 4 Argon supports 1M output tokens while Claude Fable 5.5 rolls out
Gemini 4 Argon gây chú ý với khả năng xử lý 1 triệu token đầu ra, vượt xa mức 128K của các dòng mô hình khác. Cùng lúc đó, người dùng bắt đầu ghi nhận các truy vấn được định tuyến sang Claude Fable 5.5 với cải tiến về kết quả thời gian thực và định dạng SVG.
Nvidia introduces Open Agent Safety Platform and ASR fine-tuning tutorials
Nvidia phối hợp với hơn 100 đối tác ra mắt Nền tảng An toàn Tác nhân Mở, kết hợp OpenShell và Sentry để cung cấp môi trường vận hành bảo mật cho các tác nhân AI. Ngoài ra, hãng cũng phát hành hướng dẫn tinh chỉnh mô hình nhận diện giọng nói Nemotron trên các phương ngữ tiếng Ả Rập.
Anthropic launches dedicated developer portal and documentation hub
Anthropic giới thiệu một trang thông tin mới dành riêng cho các nhà phát triển xây dựng ứng dụng với Claude, cung cấp các bài viết chuyên sâu về kỹ thuật, hướng dẫn sử dụng API và kinh nghiệm thực tế từ đội ngũ phát triển.
Grok Bot launches proactive suggestion features and coding tool integrations
Grok Bot được cập nhật khả năng tự động đề xuất hỗ trợ người dùng mà không cần yêu cầu trước. Trợ lý này cũng tích hợp sâu hơn với các công cụ phát triển phần mềm như Cursor và GitHub.
OpenAI introduces Dots, autonomous all-in-one AI agent systems
OpenAI vừa phát hành Dots, dòng tác nhân AI hoạt động liên tục 24/7 được trang bị trình duyệt và khả năng tương thích với hàng nghìn ứng dụng. Hệ thống này có khả năng tự động xử lý các tác vụ phức tạp thay mặt người dùng.
OpenAI bổ sung nền tảng Dots vào hệ sinh thái, cạnh tranh trực tiếp trong phân khúc trợ lý tự động. Điểm khác biệt lớn nhất của mô hình này là khả năng truy cập vào toàn bộ bộ nhớ ChatGPT và hàng loạt ứng dụng đi kèm.
OpenRouter integrates new decision models and highlights platform usage trends
OpenRouter bổ sung các mô hình quyết định như d1 từ Liquid AI và Pareto phiên bản mới cho các quy trình tác nhân. Nền tảng cũng ghi nhận tốc độ chuyển dịch nhanh chóng của người dùng sang các dòng mô hình mới như Opus 5.5.
DeepSeek Harness desktop versions released alongside Agent Arena Pareto updates
DeepSeek phát hành các gói cài đặt máy tính cho macOS, Windows và Linux mang tên DeepSeek Harness, hỗ trợ thực thi tác vụ và lập trình. Đồng thời, các mốc biên Pareto ghi nhận thêm nhiều mô hình mới với chi phí vận hành thấp hơn.
Qwen3.8-27B adapted into a multimodal decision-making model
Mô hình Qwen3.8-27B được tối ưu hóa thành mô hình quyết định đa phương thức với thời gian phản hồi dưới 100 ms dựa trên trạng thái trò chơi trực tiếp. Ngoài ra, Alibaba cũng phát hành mô hình hình ảnh Qwen-Image-2.1 mã nguồn mở.
OpenAI launches GPT-6.1 Sol and releases it on Agent Arena
OpenAI phát hành mô hình GPT-6.1 Sol với mức giá thấp hơn đáng kể so với hiệu năng đạt được. Mô hình này đã được đưa lên nền tảng Agent Arena để thử nghiệm và đánh giá trên các tác vụ agentic dài hạn.
OpenAI adjusts usage limits for the $200 Pro subscription and pricing structure
OpenAI mở lại gói đăng ký Pro 200 USD nhưng đồng thời thay đổi cách tính hạn mức sử dụng, khiến lượng sử dụng thực tế giảm một nửa. Các đợt điều chỉnh giá cước khác cũng được công bố cho các dòng mô hình mới.
Zhipu AI releases GLM 5.3 model family including Flash and Max variants
Dòng mô hình GLM 5.3, bao gồm cả phiên bản Flash và Max, chính thức được tích hợp vào Cursor. Nghiên cứu đi kèm cho thấy mô hình mã nguồn mở này đạt điểm số cao trên CursorBench 4.0 và có khả năng khai thác lỗ hổng bảo mật.
llama.cpp adds decision model support as webAI launches TwIL-LM3-Pro
Nền tảng llama.cpp bổ sung endpoint hỗ trợ chạy các mô hình quyết định cục bộ và hiệu quả qua endpoint mới. Cùng lúc đó, webAI phát hành mô hình TwIL-LM3-Pro dung lượng 3,66B đạt hiệu năng cao trong các bài kiểm tra logic hình thức.
AMD chính thức tiếp nhận World Labs để mở rộng năng lực nghiên cứu trong lĩnh vực mô hình thế giới và trí tuệ nhân tạo vật lý. Các hội nghị và câu lạc bộ đọc sách chuyên đề về mô hình nền tảng thế giới cũng đang được lên lịch tổ chức.
Cohere công bố dòng mô hình nhúng Embed 5 gồm hai phiên bản Pro và Fast, đồng thời kỷ niệm 7 năm thành lập công ty. Bên cạnh đó, vLLM phát hành bản cập nhật Decision 2.0 cho Semantic Router hỗ trợ xử lý nhiều câu hỏi trong một lần chuyển tiếp.
LangChain releases MCP-adapters 2.0 for TypeScript agents
LangChain đã phát hành phiên bản MCP-adapters 2.0 giúp đơn giản hóa việc kết nối các TypeScript agents với máy chủ MCP. Bản cập nhật này bổ sung hỗ trợ cho phiên bản phi trạng thái mới nhất của giao thức MCP.
CÂU HỎI — Hiện tượng ý định thay đổi của người dùng trong các tương tác đa lượt ảnh hưởng thế nào đến độ chính xác của LLM agent và làm sao để khắc phục?
In a 627-case calibration, mean task score falls from 0.476 to 0.384 as dialogues contain more superseded and withdrawn information.
CÂU HỎI — Làm thế nào để tự động hóa hoàn toàn quá trình tạo video dữ liệu từ dữ liệu dạng bảng thô với sự phối hợp của nhiều agent mà vẫn đảm bảo độ chính xác của dữ liệu và tính nhất quán của cốt truyện?
Mô hình tiên tiến nhất như GPT-5 đạt điểm chất lượng 2,13/5 với tỷ lệ thực thi thành công từ 48,62% đến 86,24%.
CÂU HỎI — Làm thế nào để cải thiện độ chính xác và tính linh hoạt trong việc lựa chọn mô hình LLM (routing) dựa trên việc phân tích bằng chứng ngữ nghĩa độc lập thay vì chỉ dựa vào embedding của câu hỏi?
Đạt độ chính xác trung bình 72,08% pm 0,45 trên LLMRouterBench gồm 15 dataset, 20 mô hình ứng viên và 11.481 truy vấn.
CÂU HỎI — Việc sử dụng các mô hình nhỏ hơn, đóng băng để tạo dữ liệu từ chối trong chưng cất ưu tiên mang lại hiệu quả như thế nào?
Smaller frozen models generate rejects with less inference compute yet train stronger students than self-generated rejects, before and after sequence-level knowledge distillation, on code generation and mathematical reasoning.
CÂU HỎI — Làm thế nào để huấn luyện các world model truyền phát (streaming world models) vượt qua giới hạn context window mà không gặp chi phí tính toán quadratic của attention?
Tăng khoảng thời gian từ 100 lên 400 giây chỉ làm tăng 12% thời gian cho mỗi bước huấn luyện.
CÂU HỎI — Làm thế nào để khắc phục hiện tượng suy giảm hiệu năng của giáo viên khi thực hiện giám sát các tiền tố do học sinh tạo ra trong on-policy distillation?
SCOUT cải thiện khả năng của giáo viên trong việc tiếp tục sinh văn bản từ các tiền tố do học sinh tạo ra.
CÂU HỎI — Làm thế nào để thay thế hiện tượng quên theo hàm mũ trong các mô hình State Space bằng động lực học phân số nhằm cải thiện khả năng xử lý ngữ cảnh dài?
FRAC thay thế sự suy giảm hàm mũ bằng bộ nhớ dài luật lũy thừa thông qua việc xấp xỉ động lực học phân số.
CÂU HỎI — Làm thế nào để giảm thiểu chi phí thu thập dữ liệu giám sát khi huấn luyện bộ điều phối LLM (LLM router) mà vẫn đảm bảo hiệu quả chi phí khi triển khai thực tế?
Sử dụng khoảng 33-41% dữ liệu phản hồi huấn luyện khả dụng trên 4 benchmark định tuyến.
CÂU HỎI — Làm thế nào để kiểm soát cường độ biểu hiện tính cách của LLM một cách chính xác theo yêu cầu?
PersonaDose raises core-trait expression at the Persona Vectors coherence floor of 75 by 33.2, 18.3, and 17.8 points over contrastive activation addition.
CÂU HỎI — Làm thế nào các lựa chọn về phân bổ lặp và cơ chế điều kiện hóa ảnh hưởng đến hiệu năng của mô hình ngôn ngữ lặp lại (LoopLMs) khi mở rộng ngân sách suy luận?
Récurrence có thể cải thiện khả năng suy luận vượt quá giới hạn huấn luyện trong khi làm giảm hiệu suất kiến thức.