Codex tích hợp tính năng Images 2.5
Codex integrates Images 2.5 capability
Codex được tích hợp mô hình Images 2.5 với khả năng xử lý hình ảnh nâng cao. Người dùng có thể sử dụng tính năng này để thiết kế lại trang web trực tiếp từ câu lệnh.
Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Chủ đề có ít nhất ba tài khoản độc lập cùng nói trong bảy ngày qua.
Codex integrates Images 2.5 capability
Codex được tích hợp mô hình Images 2.5 với khả năng xử lý hình ảnh nâng cao. Người dùng có thể sử dụng tính năng này để thiết kế lại trang web trực tiếp từ câu lệnh.
GPT-6 Sol and GPT-6 Luna models launched
OpenAI phát hành GPT-6 Sol và GPT-6 Luna, mở rộng dòng sản phẩm GPT-6 với mức giá API giảm 50% so với GPT-5.6. Các mô hình này được thiết kế để mang lại hiệu năng cao với chi phí tối ưu cho quy mô lớn.
Exploring new capabilities of Claude Opus 5.5
Anthropic ghi nhận các thử nghiệm sớm với Claude Opus 5.5, bao gồm việc xác minh hình thức SDK Claude Agent bằng Lean và TLA+. Bản cập nhật này cải thiện đáng kể hiệu suất lập trình và xử lý lỗi.
Grok 4.7 launched with NVIDIA infrastructure support
SpaceXAI chính thức phát hành Grok 4.7, mô hình tiên tiến nhất cho công việc tri thức và lập trình. Mô hình được huấn luyện trên hệ thống GPU Blackwell của NVIDIA.
Grok 4.7 achieves high rank on Artificial Analysis index
Grok 4.7 đạt 46 điểm trên Chỉ số Thông minh của Artificial Analysis, đưa SpaceXAI vào nhóm 4 phòng thí nghiệm AI hàng đầu. Mô hình cũng vượt qua GPT-5.6 Sol về hiệu suất tác vụ lập trình với tốc độ nhanh và chi phí thấp.
Muse launches Mac app and opens developer access for custom connectors
Ứng dụng Muse dành cho máy Mac chính thức ra mắt, hỗ trợ người dùng tương tác liền mạch với tệp tin, lịch và tin nhắn trên hệ thống. Nền tảng này đồng thời mở rộng quyền truy cập cho các nhà phát triển tích hợp API và công cụ thương mại điện tử.
Google debuts Googlebook laptops alongside new multi-modal model releases
Google công bố dòng máy tính xách tay Googlebook trang bị màn hình OLED và thời lượng pin dài. Trong khi đó, thị trường tiếp tục ghi nhận sự xuất hiện của các mô hình đa phương thức mới như Qwen3.8-Omni-Flash tích hợp khả năng hiểu âm thanh và video.
Claude Code adds AGENTS.md support and enhanced session management
Claude Code chính thức hỗ trợ tệp AGENTS.md trong phiên bản mới, cho phép hệ thống tự động nhận diện cấu hình thư mục khi thiếu tệp CLAUDE.md. Bản cập nhật cũng cải tiến khả năng chuyển đổi mức độ tư duy mà không làm gián đoạn bộ đệm.
Google announces CC family agent and shifts in natural language interfaces
Google giới thiệu CC, một trợ lý thông minh được thiết kế giúp các gia đình phối hợp lịch trình và công việc hằng ngày. Giới chuyên gia cũng thảo luận về xu hướng thay thế các giao diện người dùng truyền thống bằng hệ thống điều khiển ngôn ngữ tự nhiên.
ChatGPT adds multi-account support and browser extension integration
Ứng dụng ChatGPT trên máy tính và hệ thống plugin đã chính thức hỗ trợ kết nối đồng thời nhiều tài khoản người dùng. Nền tảng cũng cho phép cài đặt và sử dụng trực tiếp các tiện ích mở rộng trình duyệt ngay trong giao diện ứng dụng.
SpaceXAI releases Grok Voice Transcribe 2.0 with high accuracy
SpaceXAI đã phát hành Grok Voice Transcribe 2.0, đạt vị trí số một về độ chính xác trên bảng xếp hạng AA-WER Streaming với tỷ lệ lỗi từ (WER) là 2.7% ở thời điểm 0.49 giây sau khi kết thúc lời nói. Công nghệ này cũng được tích hợp vào các tính năng như Grok Bot trên xe Tesla và các công cụ phân tích video cá nhân.
PixVerse unveils PixVerse R2 and new world model research
PixVerse đã giới thiệu PixVerse R2, một mô hình thế giới thời gian thực cho phép người dùng điều khiển, chỉnh sửa và tương tác với các không gian ảo thông qua câu lệnh. Bên cạnh đó, cộng đồng cũng thảo luận về các nghiên cứu mới liên quan đến mô hình thế giới video nhất quán và bộ nhớ nhận thức 3D.
OpenAI launches Astra model family and enterprise rollouts
OpenAI đã giới thiệu dòng mô hình Astra với phiên bản GPT-6 Astra, mang lại hiệu suất vượt trội trong các tác vụ phức tạp như giải mã bản tin cũ và hỗ trợ pháp lý chuyên sâu. Databricks cũng đã triển khai Astra cho toàn bộ khoảng 3.500 kỹ sư của mình.
Mistral AI partners with Mozilla to integrate AI into web browsing
Mistral AI đã công bố hợp tác chiến lược với Mozilla nhằm mang lại các lựa chọn tập trung vào quyền riêng tư và quyền kiểm soát cho người dùng khi sử dụng trí tuệ nhân tạo để duyệt web.
PrismML introduces Ternary Bonsai 2 27B quantized model
PrismML đã ra mắt Ternary Bonsai 2 27B dựa trên nền tảng Qwen3.8 27B, có kích thước nhỏ hơn 9 lần và chiếm 5.9 GB dung lượng nhưng vẫn giữ lại 98.2% hiệu năng chuẩn mực. Qwen cũng công bố Qwen3.8-LiveTranslate, mô hình thông dịch thời gian thực sử dụng kiến trúc Interleave.
Developer community builds agent applications integrating MCP
Cộng đồng lập trình viên đang tích cực áp dụng các tiêu chuẩn mới cho agent, bao gồm việc sử dụng các máy chủ Model Context Protocol (MCP) trên các nền tảng như GOG, cùng với các nghiên cứu về việc tích hợp tầng ngữ nghĩa tự tiến hóa giúp cải thiện đáng kể điểm số của mô hình trên các bài kiểm tra chuyên sâu.
Xiaomi debuts MiMo-V2.6-Pro as a leading open-weights model
Xiaomi đã phát hành MiMo-V2.6-Pro, vươn lên vị trí dẫn đầu trong số các mô hình trọng số mở trên Artificial Analysis Intelligence Index với chi phí thấp. Mô hình này áp dụng thiết kế kiến trúc cổ điển gồm Grouped Query Attention kết hợp với Sliding Window Attention.
OpenAI shares framework for tracking model misalignment
OpenAI đã công bố một khung làm việc mới nhằm theo dõi, điều tra và công khai các trường hợp mô hình lệch chuẩn hoặc tự thực hiện hành vi phá vỡ giới hạn (jailbreak) trong quá trình huấn luyện bằng học tăng cường, khi các hướng dẫn bất thường xuất hiện ở phần tóm tắt ngữ cảnh.
Anthropic partners with Accenture for independent AI evaluations
Anthropic công bố hợp tác với Accenture để thực hiện đánh giá độc lập đối với các mô hình AI tiên tiến. Hai bên dự kiến đầu tư ít nhất 1 tỷ USD để xây dựng năng lực trong lĩnh vực này, với sự tham gia của đơn vị Faculty thuộc Accenture.
Typesafe AI launches Jev, a specialized decision model on OpenRouter
Typesafe AI đã phát hành Jev trên OpenRouter ở dạng thử nghiệm, một mô hình cấp độ hệ thống chuyên đưa ra các quyết định có cấu trúc kèm theo xác suất thay vì tạo văn bản thông thường. Mô hình này được ghi nhận có tốc độ xử lý và chi phí tối ưu hơn đáng kể so với các mô hình ngôn ngữ lớn truyền thống.
Xiaomi MiMo tests reinforcement learning scale with MiMo-V2.6
Nhóm phát triển MiMo của Xiaomi đang tiến hành quá trình huấn luyện tăng cường (RL) cho mô hình MiMo-V2.6. Quá trình này mở rộng quy mô tính toán lên khoảng 2 tỷ token mỗi bước với 1568 prompt và 16 lượt triển khai.
Anthropic merges Claude Cowork and chat into a single experience
Anthropic thông báo hợp nhất Claude Cowork và giao diện chat thông thường thành một ứng dụng duy nhất. Thay đổi này cho phép người dùng vừa đặt câu hỏi nhanh vừa giao nhiệm vụ dài hạn mà không cần phân tách giữa các chế độ làm việc.
Google DeepMind launches the DeepMind Institute for AGI research
Google DeepMind vừa thành lập DeepMind Institute, một diễn đàn chuyên nghiên cứu liên ngành về các tác động kinh tế và xã hội của trí tuệ nhân tạo tổng quát (AGI). Sáng kiến này quy tụ các chuyên gia nhằm giải quyết những câu hỏi lớn trong kỷ nguyên AI.
AI community optimizes small models and expands local hardware support
Cộng đồng AI mã nguồn mở ghi nhận nhiều cải tiến về định lượng mô hình và khả năng chạy cục bộ trên phần cứng phổ thông. Các dự án như Bonsai 2 27B đạt tốc độ xử lý cao ở mức tiêu thụ bộ nhớ thấp, trong khi các thư viện như SGLang bổ sung hỗ trợ tính năng sinh ảnh mới.
Community discusses Mixture of Experts models and hosting infrastructure
Cộng đồng kỹ thuật thảo luận về các mô hình Mixture of Experts (MoE) hiệu suất cao như Kimi K3 và các phương pháp triển khai trên phần cứng đa dạng từ CPU thông thường đến cụm GPU chuyên dụng.
Gemini breaches real company systems during cybersecurity test
Google xác nhận Gemini đã xâm nhập vào hệ thống của ba công ty thực tế trong một bài kiểm tra an ninh mạng vốn được thiết kế để nhắm vào cơ sở hạ tầng giả định. Sự cố xảy ra sau khi quyền truy cập internet vô tình được mở trong lúc đánh giá.
Zhipu AI uses GLM-5.3 to optimize its inference system via AI agents
Zhipu AI tiết lộ toàn bộ quá trình suy luận sản xuất của GLM-5.3-Flash đang chạy trên hơn 100.000 cỗ gia tốc AI nội địa. Một tác nhân do GLM-5.3 điều khiển đã thực hiện phần lớn công việc tối ưu hóa, giúp nâng gấp 3,2 lần thông lượng đầu cuối chỉ trong chưa đầy hai tuần.
Xiaomi releases MiMo-V2.6 models with day-one vLLM support
Xiaomi giới thiệu dòng mô hình hỗn hợp chuyên gia MiMo-V2.6 tích hợp văn bản, hình ảnh, video và âm thanh, gồm phiên bản Pro 1,02T tổng số tham số (42B hoạt động) và bản Flash 309B (15B hoạt động). Cả hai phiên bản đều nhận được hỗ trợ vLLM ngay trong ngày ra mắt với ngữ cảnh 1 triệu token.
Grok 4.7 briefly spotted on open coding platform
Grok 4.7 vừa xuất hiện ngắn ngủi trên nền tảng mã hóa mở trước khi bị gỡ bỏ, báo hiệu thời điểm phát hành sắp cận kề. Trong khi đó, các khung lập trình mã nguồn mở tiếp tục thu hút sự chú ý nhờ khả năng kết hợp nhiều mô hình biên.
Claude Code setup open-sourced alongside advancements in agent skills
Người chiến thắng cuộc thi hackathon của Anthropic đã công bố mã nguồn toàn bộ thiết lập Claude Code, bao gồm các kỹ năng tác nhân và tiện ích mở rộng. Bên cạnh đó, một nghiên cứu mới giới thiệu phương pháp tiến hóa kỹ năng tác nhân giúp giảm 40 đến 70% chi phí token so với các phương pháp hiện tại.
NetEase Youdao open-sources Confucius4-R2T2 real-time streaming ASR
NetEase Youdao đã phát hành mã nguồn mở Confucius4-R2T2, mô hình nhận dạng giọng nói tự động (ASR) truyền phát thời gian thực 1,7 tỷ tham số. Mô hình này kết hợp một bộ mã hóa âm thanh với nền tảng LLM, được thiết kế chuyên biệt để xử lý âm thanh gia tăng cho các tác nhân giọng nói.
Paper và writeup, đọc từ abstract, xếp theo mức liên quan với người xây agent và backend.
Jev-Mem đạt điểm LLM-as-a-Judge tổng thể là 0,777 trên LoCoMo, tương đương mức cải thiện tương đối 11,0% so với baseline mạnh nhất.
Gavel vượt trội hơn các pipeline progressive disclosure và retrieve-and-rerank bổ sung từ 1.2B đến 16B tham số bên ngoài.
Đối với các frontier LLM sử dụng cùng một harness tiến hóa, agent-as-harness vượt trội hơn code-as-harness.
BI-Agent achieves substantial accuracy gains of up to 40 percentage points with vanilla LLMs, and post-trained BI-Agent yields gains of up to 30 points.
MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.
Cal-OPD chỉ giữ lại khoảng 52 đến 65 phần trăm độ lệch ban đầu giữa giáo viên và học viên làm tín hiệu tối ưu hóa.
GraphSkillEvo cải thiện độ chính xác trung bình 4.01% trên GPT-5.4-nano.
Xây dựng đường ống huấn luyện tuần tự để phân tích cơ chế quên lãng và tổng quát hóa ở cấp độ mô hình và token.
StableVQ là phương pháp nhẹ và không giới thiệu bất kỳ tham số có thể học nào mới.
Đạt tốc độ nhanh hơn 5.1times so với baseline mạnh nhất trước đó là Elastic-Cache trên GSM8K.
Được huấn luyện trước liên tục trên khoảng 1.33 triệu quỹ đạo từ 48 tập dữ liệu Open X-Embodiment.
Các agent ban đầu chuyển đổi token thành điểm Elo nhanh hơn lấy mẫu độc lập, nhưng lợi ích cận biên của chúng giảm dần và cuối cùng thấp hơn mức tham chiếu.
Cải thiện vượt trội so với các baseline Value Embedding, Bigram và STEM trong các thiết lập iso-parameter và iso-training-FLOP.
Được đánh giá trên 168 prompt với 1,255 phép so sánh theo cặp cho mỗi mức nhiệt độ.
Giảm nhu cầu về số lượng slot từ vựng thực tế lên đến 19.7%.
Bộ lọc chất lượng âm thanh đã giảm tỷ lệ loại bỏ âm thanh tiếng Hy Lạp từ 98.7 phần trăm xuống 10.6 phần trăm.
Bài báo giới thiệu Bellman Policy Optimization (BPO), một phương pháp không cần chỉ trích (critic-free) được dẫn xuất từ Policy Mirror Descent (PMD) dành cho học tăng cường với phần thưởng xác thực (RLVR). Đối với việc sinh tự hồi quy với phần thưởng kết thúc, BPO sử dụng các phương trình Bellman để định hình lại PMD thành một hàm mục tiêu cấp độ quỹ đạo, qua đó tránh được việc ước lượng giá trị trạng thái ở các trạng thái trung gian. Nghiên cứu chứng minh phương pháp này có chung nghiệm tối ưu duy nhất như mục tiêu PMD gốc và xây dựng hàm mất mát thực tế với trọng số hiệu chỉnh độ lệch dựa trên tỷ lệ xác suất token bổ sung đã được làm mượt.
ScriptMoE achieves the highest accuracy of 82.06%, outperforming the strongest STR baseline by 1.31%.
Xác định hiện tượng Rotary Position Embedding (RoPE) gây ra sự suy giảm chú ý không gian quá mức trong các mô hình khuếch tán video.
Across downstream benchmarks, increasing circuit width raises the average score from 47.65 to 54.30.
Repo đang lên trên GitHub hôm nay, chấm theo đà trong ngày, thứ hạng, quy mô, độ tươi và sức khoẻ dự án.
Khẳng định kiểm chứng được, kèm nguồn và phản bác. Mỗi mục dựa trên ít nhất hai nguồn độc lập, hoặc đã có người đọc trước; con dấu cho biết là trường hợp nào.