OpenAI releases GPT-6 Sol and GPT-6 Luna alongside Tesseract video tools
OpenAI đã giới thiệu dòng mô hình GPT-6 Sol và GPT-6 Luna kế thừa từ GPT-6 Astra nhằm cung cấp các tùy chọn nhanh và tiết kiệm chi phí hơn. Đồng thời, hãng cũng ra mắt Tesseract, một bộ công cụ sáng tạo video dành cho các tác nhân AI.
SpaceXAI launches Grok 4.7 with high performance on the Artificial Analysis Intelligence Index
SpaceXAI đã phát hành Grok 4.7, đạt 46 điểm trên Artificial Analysis Intelligence Index và đưa phòng nghiên cứu này vào top 4 các phòng thí nghiệm AI. Mô hình này cải thiện hiệu suất lập trình đáng kể với tốc độ cao và chi phí thấp.
Anthropic releases Claude Opus 5.5 with 40% lower operating costs
Anthropic đã giới thiệu Claude Opus 5.5, mẫu mô hình đầu tiên trong gia đình Claude 5.5 đạt hiệu năng tương đương Claude Fable 5.1 nhưng có chi phí vận hành thấp hơn 40% so với phiên bản Opus 5.
DigitalOcean announces public preview of Managed Agents
DigitalOcean đã tung ra bản public preview cho dịch vụ Managed Agents, cho phép chạy các tác nhân như Claude Code hoặc Codex trong môi trường thời gian thực tự động tạm dừng khi không hoạt động.
NVIDIA provides accelerated computing infrastructure for Grok 4.7 and the AI ecosystem
Hạ tầng tính toán tăng tốc của NVIDIA tiếp tục hỗ trợ các mô hình trong hệ sinh thái AI, trong đó có việc hậu thuẫn cho Grok 4.7 của SpaceXAI trong các tác vụ lập trình và xử lý tri thức.
ChatGPT expands voice capabilities, multi-account plugins, and Chrome extensions
OpenAI cập nhật ứng dụng ChatGPT với khả năng giọng nói tích hợp plugin từ email, lịch và Slack. Nền tảng cũng cho phép kết nối nhiều tài khoản với plugin và hỗ trợ tiện ích mở rộng Chrome trên ứng dụng máy tính.
Google launches Gemini 3.8 Flash and Flash-Lite TTS audio model family
Google giới thiệu Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, các mô hình chuyển văn bản thành giọng nói với hơn 2.000 giọng đọc chuẩn sản xuất và hỗ trợ 100 ngôn ngữ. Cập nhật này cũng mở rộng tính năng cho Gemini 3.8 Live trong công cụ tìm kiếm.
DeepSeek advances large model development and outlines hardware training roadmap
DeepSeek đang tiến hành huấn luyện các mô hình quy mô lớn 2 nghìn tỷ và 8 nghìn tỷ tham số, đồng thời dự kiến sử dụng chip huấn luyện của Huawei vào cuối năm 2026 hoặc đầu năm 2027. Nền tảng cũng tích hợp mô hình DeepSeek V4.1 Flash vào các công cụ phát triển.
Muse launches Mac app integrating versatile AI agent assistant for developers
Ứng dụng Muse cho máy tính Mac chính thức phát hành, hoạt động trên các tệp tin, lịch, ghi chú và tin nhắn. Nền tảng này mở quyền truy cập cho các nhà phát triển xây dựng trình kết nối API và hợp tác với Shopify để tối ưu hóa mua sắm.
Google introduces Googlebook laptop line powered by Android and ChromeOS stack
Google ra mắt Googlebook, dòng laptop mới trang bị màn hình cảm ứng OLED độ phân giải 2.8K và thời lượng pin 14 giờ. Thiết bị chạy trên nền tảng công nghệ Android kết hợp với hệ sinh thái máy tính để bàn ChromeOS.
Anthropic partners with Accenture on independent evaluation and establishes biological lab
Anthropic hợp tác với Accenture để thực hiện đánh giá độc lập đối với các hệ thống AI tiên tiến với khoản đầu tư ít nhất 1 tỷ USD. Công ty cũng đã thành lập một phòng thí nghiệm sinh học vật lý tại San Francisco để tiến hành nghiên cứu thực nghiệm.
NVIDIA releases Nemotron 3 Diarization model for multi-speaker audio tracking
NVIDIA phát hành mô hình Nemotron 3 Diarization với 100 triệu tham số, có khả năng theo dõi tối đa tám người nói và xử lý giọng nói chồng chéo. Hệ thống giúp xác định chính xác thời điểm từng người phát biểu trong các đoạn ghi âm phức tạp.
Claude Code adds AGENTS.md configuration support and cloud session capabilities
Claude Code cập nhật phiên bản 2.1.277, hỗ trợ tệp AGENTS.md khi thư mục không có tệp CLAUDE.md. Tính năng phiên làm việc trên mây cũng chính thức ra mắt, cho phép Claude tiếp tục thực hiện các tác vụ song song ngay cả khi người dùng đóng máy tính.
Introduction of the CC agent and lobbying efforts over AI regulation
Google vừa công bố CC, một trợ lý AI được thiết kế để hỗ trợ các gia đình quản lý lịch trình và công việc chung. Trong một diễn biến khác, các lãnh đạo công nghệ lớn được cho là đã thúc ép chính quyền loại bỏ một đề xuất quản lý AI do người đứng đầu Google DeepMind đề xuất.
Research on self-evolving ontologies and MCP integration for agents
Các nghiên cứu mới đây cho thấy việc áp dụng tầng ontology tự phát triển giúp cải thiện đáng kể hiệu suất của các tác nhân AI trên các benchmark phức tạp. Bên cạnh đó, hệ sinh thái công cụ cũng đang mở rộng với việc tích hợp các máy chủ Model Context Protocol.
PixVerse unveils the R2 world model and the impact of harness design
PixVerse đã ra mắt R2, mô hình thế giới thời gian thực cho phép người dùng tương tác và chỉnh sửa môi trường sống động bằng câu lệnh. Ngoài ra, các nghiên cứu cũng chỉ ra rằng việc sử dụng khung điều khiển (harness) phù hợp có thể nâng cao đáng kể độ chính xác của mô hình trong các tác vụ robot dài hạn.
Release of Ternary Bonsai 2 27B and the Qwen3.8 real-time translation model
Ternary Bonsai 2 27B vừa được ra mắt với kích thước nhỏ hơn 9 lần so với nguyên bản Qwen3.8 nhưng vẫn duy trì 98.2% hiệu suất benchmark. Cùng lúc đó, dòng Qwen3.8 cũng bổ sung phiên bản LiveTranslate chuyên dụng cho dịch thuật đồng thời thời gian thực.
MiMo-V2.6-Pro leads the open weights rankings on Artificial Analysis
MiMo-V2.6-Pro vừa vươn lên vị trí dẫn đầu trong số các mô hình có trọng số mở trên bảng xếp hạng của Artificial Analysis. Mô hình này sử dụng kiến trúc chú thích truy vấn nhóm cổ điển và đạt hiệu quả cao trên biên Pareto giữa năng lực và chi phí.
Grok 4.7 xHigh competes at the top alongside updates on Kimi K3
Grok 4.7 xHigh đã đạt mức điểm sát nút với các mô hình dẫn đầu trên benchmark AA-Briefcase của Artificial Analysis. Trong khi đó, các thông tin mới hé lộ sự chuẩn bị ra mắt của Kimi K3.1 và khả năng chạy mô hình dung lượng lớn trên phần cứng tối thiểu.
Discussions on automated AI research and multi-agent systems
Cộng đồng thảo luận về tiềm năng tự động hóa nghiên cứu khoa học thông qua các hệ thống đa tác nhân. Các ý kiến xoay quanh triển vọng và thách thức khi siêu trí tuệ có khả năng tự phát triển các tiến bộ toán học và kỹ thuật.
Optimizing inference systems and accelerating execution for large language models
智谱 công bố GLM-5.3-Flash vận hành trên hơn 10.000 bộ tăng tốc AI nội địa, đạt mức tăng 3,2 lần về thông lượng nhờ tối ưu hóa tự động bằng tác nhân AI. Trong khi đó, các mô hình như DiffusionGemma và Ternary-Bonsai được tích hợp vào các framework vLLM và MLX.
DeepSeek trials large-scale server infrastructure and Xiaomi launches MiMo-V2.6
DeepSeek vận hành các đơn vị quy mô sản xuất gồm khoảng 160 nút, phục vụ khoảng 3 triệu hộp cát mỗi ngày. Cùng lúc, Xiaomi phát hành dòng MiMo-V2.6 gồm hai phiên bản Pro và Flash, trong đó bản Pro đạt 46 điểm trên bảng đánh giá Artificial Analysis.
Running local open-weight models on constrained hardware devices
Các nhà phát triển triển khai mô hình 27 tỷ tham số định dạng tam phân ở mức 1,72 bit mỗi trọng số trên một card đồ họa duy nhất với 12GB VRAM. Bên cạnh đó, các bản cập nhật tích hợp nhân Metal của llama.cpp và hỗ trợ SGLang cho mô hình tạo ảnh đã được phát hành.
Alibaba announces large-scale AI infrastructure plans and RecreationWorld sandbox
Alibaba đặt mục tiêu đạt 20 gigawatt công suất trung tâm dữ liệu toàn cầu vào năm 2032 cùng kế hoạch phát triển dòng mô hình Qwen từ 5 đến 10 nghìn tỷ tham số. Nhóm nghiên cứu Qwen cũng phát hành RecreationWorld, một không gian mô phỏng năm nền tảng cho các tác nhân sử dụng máy tính.
Improving skill optimization methods for AI agents
Các nhà nghiên cứu giới thiệu phương pháp mới giúp tác nhân AI tự cải thiện lời nhắc kỹ năng thông qua việc xếp hạng các ứng viên, giúp giảm từ 40% đến 70% chi phí mã thông báo so với các phương pháp thông thường. NVIDIA cũng công bố cách chuyển đổi kỹ năng tác nhân thành môi trường học tăng cường.
Evaluating safety refusal rates on coding agent benchmarks
Artificial Analysis tích hợp tính năng báo cáo tỷ lệ từ chối an toàn vào phiên bản 1.5 của bộ chỉ số Tác nhân Lập trình nhằm giải thích sự khác biệt về hành vi giữa các mô hình. Dữ liệu cho thấy các mô hình khác nhau có tỷ lệ từ chối an toàn đáng chú ý khi thực hiện các tác vụ lập trình.
Automated learning applications and improved retrieval methods for finance
Một nghiên cứu phối hợp từ các trường đại học giới thiệu phương pháp giúp tác nhân tài chính tự học hỏi từ các lỗi trong hồ sơ SEC, yêu cầu mọi hành vi mới phải vượt qua bài kiểm tra hồi quy trước khi áp dụng. Các hệ thống truy xuất dữ liệu thích ứng mới cũng được phát triển để phục vụ các truy vấn chuyên biệt.
CÂU HỎI — Làm thế nào để xây dựng một hệ thống tương tác full-duplex tích hợp khả năng nhận thức liên tục, điều khiển cuộc hội thoại và thực thi tác vụ nền bất đồng bộ bằng các 9B model?
Realtime-Venus-Omni đạt điểm số cao nhất trên sáu trong số tám video benchmark, bao gồm StreamingBench (70.2%), OVO-Bench (64.7%) và Daily-Omni (81.3%).
CÂU HỎI — Làm thế nào để chuyển đổi và chia nhỏ các tài liệu doanh nghiệp định dạng hỗn hợp (PDF, Word, scan) thành dữ liệu Markdown tối ưu cho retrieval mà vẫn tiết kiệm chi phí token và thời gian xử lý?
Trên tập benchmark gồm 236 tài liệu và 795 trang PDF, D-RAC chuyển đổi và chia nhỏ toàn bộ corpus trong 72 phút với 0 lỗi, tạo ra 1,748 chunk sẵn sàng cho retrieval.
CÂU HỎI — Làm thế nào để khắc phục hiện tượng see-saw giữa các task category trong quá trình huấn luyện reinforcement learning cho software engineering agents?
The final MOPD policy achieves mean resolution of 58.04% on Pro-618 and 59.00% on SWE-bench Multilingual.
CÂU HỎI — Làm thế nào để định nghĩa toán học token-level credit và cải thiện quá trình huấn luyện actor-critic trong LLM post-training?
Trong lý luận toán học dạng agentic, PACT đạt độ chính xác trung bình 72.87% trên bốn benchmark, vượt qua GRPO và PPO lần lượt là 8.80 và 13.16 điểm phần trăm.
CÂU HỎI — Làm thế nào để cung cấp bộ nhớ ngữ cảnh dài hạn cho các Vision-Language-Action models mà không làm phình to context hay tăng độ trễ inference?
MemBodied đạt tỷ lệ thành công trung bình gấp 7.81times so với chính sách phi trạng thái và 2.98times so với vanilla recurrent memory trên năm tác vụ RMBench.
CÂU HỎI — Làm thế nào để sử dụng một decision-only judge nhằm giảm chi phí suy luận của LLM-as-a-judge mà vẫn đảm bảo độ chính xác?
JEV is within three percentage points of a state-of-the-art LLM judge on ordinary preference and evidence-grounded factuality at 0.36% of the comparator's fee.
CÂU HỎI — Nguyên nhân gốc rễ nào gây ra sự bất ổn định trong quá trình huấn luyện Reinforcement Learning toàn pipeline bằng FP8 cho LLM, và làm thế nào để khắc phục nó?
Nhiễu lượng tử hóa FP8 tích lũy làm bóp méo tỷ lệ quan trọng, đẩy các token có lợi thế âm ra ngoài vùng tin cậy và làm mất gradient của chúng.
CÂU HỎI — Làm thế nào để truyền đạt các biểu diễn thế giới vật lý từ world model sang các mô hình Vision-Language-Action nhỏ gọn mà không làm tăng độ trễ thời gian chạy?
Chính sách triển khai chạy trong 32 ms và chiếm 1.86 GB trên GPU tiêu dùng RTX 5090, hoàn toàn giống về cấu trúc với baseline không chưng cất.
CÂU HỎI — Làm thế nào để xây dựng một họ embedding đa phương thức toàn diện hỗ trợ văn bản, hình ảnh, video và âm thanh trong cùng một không gian biểu diễn chung?
Ovis-Embedding achieves state-of-the-art performance on MMEB-v3, MMEB-v2, MVEB, MAEB, and RTEB.
CÂU HỎI — Làm thế nào để cải thiện độ chính xác của ước tính gradient khi phân bổ giám sát thưa thớt từ giáo viên trong quá trình chưng cất trực tuyến (on-policy distillation)?
Sparse configurations matching or exceeding full OPD without token selection at small token budgets of 0.1%--1%.
CÂU HỎI — Làm thế nào để tối ưu hóa chính sách học tăng cường (RL) cho tác vụ tạo mã SVG mở mà không phụ thuộc vào dữ liệu ground truth hay nhãn ưu đãi của con người?
Prompt một VLM judge với rubric nhiều trục tương quan tốt hơn với phán đoán của con người so với các thang đo scalar.
CÂU HỎI — Cơ chế bộ nhớ nào duy trì tính liên tục và thông tin lịch sử trong việc tạo video tự hồi quy khi đối mặt với giới hạn ngữ cảnh?
Bài báo cung cấp một tổng quan hệ thống và toàn diện về các cơ chế bộ nhớ trong việc tạo video tự hồi quy (AR). Khi chuỗi video mở rộng, các mô hình thực tế phải hoạt động dưới các giới hạn nghiêm ngặt về cửa sổ ngữ cảnh, bộ nhớ lưu trữ và tính toán, khiến thông tin lịch sử quan trọng bị trôi đi. Nghiên cứu định hình bộ nhớ theo phương diện vận hành như thông tin lịch sử được duy trì qua các bước AR bên ngoài để ảnh hưởng đến việc tạo tương lai. Các tác giả tổ chức tài liệu theo năm góc nhìn bổ sung: Hình thức (Forms), Chức năng (Functions), Hoạt động (Operations), Học tập (Learning) và Đánh giá (Evaluation), qua đó đặt nền tảng cấu trúc cho các hệ thống tạo video điều kiện hóa bộ nhớ đáng tin cậy.
CÂU HỎI — Làm thế nào để phát triển, huấn luyện và đánh giá các MLLM thực hiện việc sắp xếp đồ vật bằng robot theo chuỗi thời gian dài và khép kín?
PackLab-VLM vượt trội hơn các heuristic đóng gói thông thường, phương pháp reinforcement learning truyền thống và các MLLM đa dụng trên các tập đối tượng và cấu hình container khác nhau.
CÂU HỎI — Làm thế nào để xây dựng một không gian tiềm ẩn (latent space) chuẩn hình học nhằm cải thiện tính nhất quán 3D và chất lượng hình ảnh trong việc tạo dựng world generation?
Thay thế latent thông thường bằng GAE làm giảm chỉ số FVD xuống 12.7% và 23.1% lần lượt trên các tập dữ liệu RealEstate10K và DL3DV.
Khẳng định kiểm chứng được, kèm nguồn và phản bác. Mỗi mục dựa trên ít nhất hai nguồn độc lập, hoặc đã có người đọc trước; con dấu cho biết là trường hợp nào.
HAI NGUỒN · CHƯA ĐỌC
01 · 24 thg 9, 2026 · claude · 2 nguồn
Claude đã phát hiện ra một loại enzyme chưa từng được mô tả trước đây giống như CRISPR thông qua quá trình tìm kiếm cơ sở dữ liệu trình tự DNA bởi các tác nhân AI.
“We’ve set up a molecular biology lab at Anthropic and we’re announcing our first discovery! Claude discovered a new CRISPR-like enzyme. 950 agents spent 21 hours searching through a database of DNA sequences until one of the agents found something striking”