Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
NGHE 145 TÀI KHOẢN
Tổng hợp trong ngàydo mô hình viết
01Anthropic ra mắt mô hình Sonnet 5.5Anthropic đã giới thiệu Claude Sonnet 5.5 với tốc độ nhanh hơn và chi phí thấp hơn, đồng thời tăng cường các biện pháp bảo vệ chống tấn công chưng cất.→ 11
Video trong ngày
cuộn số 9 · 1:04
NHÃNarchitecture · 23 tiếng nói
Google ra mắt Gemini 4 Argon với giới hạn đầu ra 1 triệu token
Google công bố mô hình Gemini 4 Argon, mang lại hiệu suất vượt trội trong các tác vụ kỹ thuật phần mềm và an ninh mạng thực tế. Mô hình sở hữu giới hạn đầu ra 1 triệu token và được triển khai ban đầu cho các nhà thử nghiệm tin cậy.
Thứ Hai, 5 tháng 10: điều nhiều nguồn độc lập cùng nói.
Google ra mắt Gemini 4 Argon với giới hạn đầu ra 1 triệu token.
Google công bố mô hình Gemini 4 Argon, mang lại hiệu suất vượt trội trong các tác vụ kỹ thuật phần mềm và an ninh mạng thực tế.
Các mô hình mới đạt thứ hạng cao trên các bảng xếp hạng AI.
Nhiều mô hình trí tuệ nhân tạo mới đạt kết quả cao trên các bảng xếp hạng kỹ thuật số và chỉ số anاب mạng.
ChatGPT mở rộng tính năng plugin và nâng cấp dung lượng cho phiên bản GPT-6.1 Sol.
ChatGPT triển khai hệ thống đề xuất plugin trong các cuộc trò chuyện và bổ sung năng lực máy chủ cho mô hình GPT-6.1 Sol nhằm đáp ứng lưu lượng truy cập lớn từ API và người dùng đăng ký.
OpenAI ra mắt dòng mô hình GPT-6 với GPT-6 Astra và GPT-6.1 Sol.
OpenAI đã giới thiệu dòng mô hình GPT-6, bao gồm phiên bản GPT-6 Astra chạy trên phần cứng NVIDIA và mô hình tiết kiệm chi phí GPT-6.1 Sol.
30 chủ đề hôm nay, ít nhất ba nguồn độc lập cho mỗi chủ đề.
Nguồn có trên consonance.fyi.
Đang được bàn
30 · chủ đề
Chủ đề có ít nhất ba tài khoản độc lập cùng nói trong bảy ngày qua.
Claude Code supports UI and behavior customization through mods and plugins
Claude Code cho phép người dùng cá nhân hóa giao diện và hành vi thông qua các bản mod dạng plugin TypeScript. Nền tảng cũng tích hợp sẵn plugin 'You should know' để quét và thông báo các thông tin quan trọng từ đầu ra của mô hình.
New models achieve top rankings across AI evaluation benchmarks
Nhiều mô hình trí tuệ nhân tạo mới đạt kết quả cao trên các bảng xếp hạng kỹ thuật số và chỉ số anاب mạng. Google ra mắt Gemini 4 Argon đạt hiệu suất tương đương GPT-6 Astra với chi phí thấp hơn, trong khi Grok 4.7 đứng đầu bảng xếp hạng AA Cyber Index và Claude Opus 5.5 cải thiện độ chính xác trên Drone-Bench.
ChatGPT expands plugin ecosystem and rolls out capacity upgrades for GPT-6.1 Sol
ChatGPT triển khai hệ thống đề xuất plugin trong các cuộc trò chuyện và bổ sung năng lực máy chủ cho mô hình GPT-6.1 Sol nhằm đáp ứng lưu lượng truy cập lớn từ API và người dùng đăng ký. Nền tảng cũng mở rộng tích hợp các công cụ tạo nội dung số.
Google launches Gemini 4 Argon with a 1 million token output limit
Google công bố mô hình Gemini 4 Argon, mang lại hiệu suất vượt trội trong các tác vụ kỹ thuật phần mềm và an ninh mạng thực tế. Mô hình sở hữu giới hạn đầu ra 1 triệu token và được triển khai ban đầu cho các nhà thử nghiệm tin cậy.
Muse ecosystem expands with open-source firmware and hardware tools
Dự án Muse giới thiệu Muse Gadgets, bao gồm firmware nguồn mở ESP32 và SDK Linux để phát triển thiết bị phần cứng tương thích với hệ thống Muse. Động thái này diễn ra song song với việc phát hành liên tục các mô hình hình ảnh, video và mã nguồn.
Gemini 4 Argon launches with lower task execution costs than competing models
Google phát hành Gemini 4 Argon với mức giá vận hành thấp hơn đáng kể trên mỗi tác vụ so với các mô hình đối thủ như Astra và Opus, đồng thời hỗ trợ xử lý các bài toán dài bước nhờ giới hạn đầu ra 1 triệu token.
OpenAI releases GPT-6 models including GPT-6 Astra and GPT-6.1 Sol
OpenAI đã giới thiệu dòng mô hình GPT-6, bao gồm phiên bản GPT-6 Astra chạy trên phần cứng NVIDIA và mô hình tiết kiệm chi phí GPT-6.1 Sol. Các mô hình này mang lại tốc độ vượt trội và khả năng xử lý đa phương thức mạnh mẽ cho người dùng trả phí và qua API.
ChatGPT adds native support for building and deploying MCP servers directly
ChatGPT đã bổ sung tính năng cho phép người dùng xây dựng và triển khai các máy chủ Model Context Protocol trực tiếp ngay trên nền tảng. Cải tiến này giúp mở rộng khả năng kết nối dữ liệu và tích hợp các tiện ích mở rộng một cách linh hoạt.
Devin integrates ChatGPT subscription billing and rolls out major price cuts
Công cụ lập trình tự động Devin đã cho phép người dùng sử dụng hạn mức từ gói ChatGPT Plus hoặc Pro trực tiếp trên nền tảng. Đồng thời, nền tảng này cũng cắt giảm đáng kể chi phí cho các gói dịch vụ trong khi vẫn cải thiện năng lực xử lý.
Anthropic launches dedicated developer portal and resource hub for Claude
Anthropic đã khai trương một trang web chuyên biệt dành cho các nhà phát triển xây dựng ứng dụng với Claude. Nền tảng mới này cung cấp các bài viết chuyên sâu về kỹ thuật, hướng dẫn sử dụng API và tài nguyên từ đội ngũ phát triển.
Anthropic introduces Claude Sonnet 5.5 with higher speed and lower cost
Anthropic đã giới thiệu Claude Sonnet 5.5, bản nâng cấp mang lại tốc độ xử lý nhanh hơn 30% và chi phí thấp hơn so với thế hệ tiền nhiệm. Mô hình này hiện cũng được sử dụng làm nền tảng cho gói miễn phí của dịch vụ.
GLM models expand availability across Cursor and Hugging Face ecosystems
Các mô hình GLM, bao gồm phiên bản 5.3 và 5.3 Flash, đã chính thức có mặt trên môi trường lập trình Cursor. Dòng mô hình mã nguồn mở trọng số mở này đạt điểm số cao trên bảng đánh giá CursorBench 4.0.
OpenRouter adds new models and reports high usage share for Claude Opus 5.5
OpenRouter đã tích hợp nhiều mô hình mới như d1 từ Liquid AI và bản xem trước Pareto 26.10 lên nền tảng. Trong khi đó, Claude Opus 5.5 nhanh chóng chiếm tỷ trọng chi tiêu và token cao nhất trong số các mô hình của Anthropic trên hệ thống.
OpenAI launches Dots, an always-on AI agent system
OpenAI đã ra mắt Dots, hệ thống trợ lý ảo thông minh chạy liên tục 24/7 được tích hợp với trình duyệt và hàng nghìn ứng dụng. Hệ thống này có khả năng tự động xử lý các tác vụ phức tạp như tự động hóa nhắn tin với bộ phận hỗ trợ khách hàng.
OpenAI launches Dots integrating ChatGPT memory and competing in the bot market
OpenAI vừa chính thức phát hành Dots, một sản phẩm cạnh tranh trực tiếp với các trợ lý bot trên thị trường. Điểm khác biệt lớn nhất của nền tảng này là khả năng truy cập toàn bộ bộ nhớ và các tương tác trước đó của người dùng trong hệ sinh thái ChatGPT, hoạt động liên tục 24/7.
Alibaba đã phát hành mô hình tạo ảnh mở Qwen-Image-2.1 với 7 tỷ tham số hình ảnh, vươn lên vị trí số một trên bảng xếp hạng các mô hình trọng số mở. Cùng lúc đó, các nhà phát triển cũng tích hợp các mô hình Qwen3.8 vào các quy trình làm việc đa bước và nền tảng ra quyết định.
Nvidia introduces the Open Agent Safety Platform for secure sandboxing
NVIDIA đã hợp tác với hơn 100 đối tác công nghiệp để ra mắt Nền tảng An toàn Trợ lý Ảo Mở, tích hợp hai công nghệ OpenShell và Sentry. Sáng kiến này nhằm cung cấp các ranh giới bảo mật và công cụ cách ly mạnh mẽ hơn cho các hệ thống tác tử trí tuệ nhân tạo hoạt động dài ngày.
OpenAI prepares to launch an always-on assistant named o or Aeon
Nhiều thông tin rò rỉ cho thấy OpenAI chuẩn bị công bố một trợ lý ảo hoạt động toàn thời gian mang tên o hoặc Aeon. Sự kiện này diễn ra sau khi đội ngũ kỹ thuật ghi nhận những bước nhảy vọt đáng kể về năng suất từ các công cụ nội bộ trước đó.
OpenAI adjusts usage limits and pricing structure for Pro subscriptions
OpenAI mở cửa trở lại các gói thuê bao Pro với mức giá 200 USD đồng thời thay đổi phương thức tính toán hạn mức sử dụng. Việc điều chỉnh này làm giảm một nửa lượng hạn mức tính theo mô hình cũ đối với người dùng đăng ký.
OpenAI hosts a live keynote event with an online livestream
OpenAI tổ chức một sự kiện hội nghị trực tiếp vào lúc 10 giờ sáng theo giờ Thái Bình Dương, đồng thời cung cấp đường dẫn phát trực tuyến toàn cầu cho người theo dõi từ xa.
OpenAI reports model extraction campaign linked to Moonshot AI developers
OpenAI ghi nhận một chiến dịch nhằm trích xuất các lý luận ẩn bên trong các mô hình của hãng. Theo thông tin từ OpenAI, một phần cốt lõi của hoạt động này xuất phát từ các cá nhân có liên quan đến công ty phát triển Moonshot AI.
4 tài khoản độc lập13 bài1 bài viết18.555 tương tác
New research explores video world models and physics reasoning
Cộng đồng nghiên cứu AI tiếp tục phát triển các mô hình thế giới video và cải thiện khả năng suy luận vật lý. Các công trình mới tích hợp cơ chế nhận thức không gian và điều khiển hành động nhằm khắc phục lỗi vật lý trong video do AI tạo ra.
DeepSeek pauses free V4.1-Flash promotion following high abuse
DeepSeek đã phải tạm dừng chương trình khuyến mãi miễn phí cho mô hình V4.1-Flash do lưu lượng truy cập lạm dụng tăng cao bất thường. Đội ngũ phát triển đang điều tra và tìm giải pháp khắc phục tình trạng này.
Summary of recent AI industry announcements and updates
Các nguồn tin trong cộng đồng đã tổng hợp lại toàn bộ các thông báo, sự kiện và bài viết nổi bật diễn ra trong ngành trí tuệ nhân tạo. Người dùng có thể theo dõi các liên kết tổng hợp để cập nhật thông tin chi tiết về các sản phẩm mới ra mắt.
Advances in reinforcement learning and updates to video generation benchmarks
Cộng đồng kỹ thuật đang chia sẻ các phương pháp tiếp cận học tăng cường với phần thưởng có thể kiểm chứng (RLVR) và tối ưu hóa chính sách nhóm tương đối (GRPO). Đồng thời, các bảng xếp hạng mô hình chuyển đổi hình ảnh thành video ghi nhận sự xuất hiện của nhiều hệ thống mới.
3 tài khoản độc lập7 bài3.216 tương tác
deepseek r1reinforcement learning with verifiable rewards
vLLM adds day-0 support for new open-weights models and scaling infrastructure
Hệ thống vLLM đã cập nhật hỗ trợ cho nhiều mô hình mở trọng số mới như IQuest-Q1 và triển khai các bộ định tuyến ngữ nghĩa cải tiến. Các nhóm phát triển đang tập trung tối ưu hóa việc quản lý bộ nhớ đệm KV và phối hợp tiền nạp trên quy mô lớn.
Google DeepMind publishes new surveys and research on AI agency and consciousness
Google DeepMind đã phát hành một báo cáo khảo sát chi tiết về các lý thuyết liên quan đến ý thức máy móc. Các nhà nghiên cứu cũng thảo luận về tác động của các tác nhân AI tự trị đối với lượng token tiêu thụ và tiềm năng ứng dụng trong khoa học.
LangChain releases mcp-adapters 2.0 and Deep Agents course
LangChain phát hành mcp-adapters phiên bản 2.0 với hỗ trợ giao thức MCP không trạng thái mới nhất cho các tác vụ TypeScript và các công cụ tương tác. Nền tảng này đồng thời cập nhật chương trình LangChain Academy với nội dung về Deep Agents và giới thiệu công cụ triển khai một dòng lệnh Managed Deep Agents.
CÂU HỎI — Làm thế nào để xây dựng một hệ thống tương tác full-duplex tích hợp khả năng nhận thức liên tục, điều khiển cuộc hội thoại và thực thi tác vụ nền bất đồng bộ bằng các 9B model?
Realtime-Venus-Omni đạt điểm số cao nhất trên sáu trong số tám video benchmark, bao gồm StreamingBench (70.2%), OVO-Bench (64.7%) và Daily-Omni (81.3%).
CÂU HỎI — Làm thế nào để tích hợp khả năng xử lý đa phương thức (omni-native) vào các agent hiện có mà không cần cập nhật mô hình nền tảng đắt đỏ?
Its 27 Skills cover 38 representative tasks spanning seven artifact modalities and four capability families: understanding, generation, reasoning, and retrieval.
CÂU HỎI — How to autonomously construct specialized harnesses, improve them through experience, and orchestrate them across domains instead of manually engineering a single domain-specific harness?
Raven là một hệ sinh thái multi-agent tự động xây dựng và tiến hóa các modular harness cho các mô hình và domain cụ thể.
CÂU HỎI — Các thành phần cốt lõi của harness như quản lý ngữ cảnh, lập kế hoạch và không gian hành động ảnh hưởng như thế nào đến hiệu năng của agent lập trình?
Quản lý ngữ cảnh ngăn chặn lỗi tràn ngữ cảnh và cực kỳ giá trị khi ngân sách cửa sổ ngữ cảnh eo hẹp.
CÂU HỎI — Làm thế nào để cải thiện độ tin cậy của mô hình ngôn ngữ bằng cách tận dụng lịch sử trải nghiệm quá khứ thay vì chỉ dựa vào quá trình suy luận hiện tại?
XConf đánh bại hoặc tương đương với mười mẫu self-consistency về khả năng phân biệt (AUROC) trên 23 trong tổng số 24 so sánh.
CÂU HỎI — Làm thế nào để chuyển đổi và chia nhỏ các tài liệu doanh nghiệp định dạng hỗn hợp (PDF, Word, scan) thành dữ liệu Markdown tối ưu cho retrieval mà vẫn tiết kiệm chi phí token và thời gian xử lý?
Trên tập benchmark gồm 236 tài liệu và 795 trang PDF, D-RAC chuyển đổi và chia nhỏ toàn bộ corpus trong 72 phút với 0 lỗi, tạo ra 1,748 chunk sẵn sàng cho retrieval.
CÂU HỎI — Dữ liệu huấn luyện dài hạn mang tính phản chiếu (long-horizon reflective data) có giúp cải thiện khả năng tự tinh chỉnh của agent LLM qua nhiều vòng lặp không?
Agent đạt 81.8 trên MLE-bench Lite và 70.7 trên Frontier-CS.
CÂU HỎI — Làm thế nào để xử lý các luồng dữ liệu mở rộng với số lượng phần tử biến đổi trong các đường ống chuẩn bị dữ liệu mô hình nền tảng mà vẫn duy trì được quan hệ phả hệ (lineage) trên GPU?
RayOrch achieves 15.14 times speedup when scaling MinerU from 4 to 64 GPUs and 7.82 times speedup when scaling a video pipeline from 8 to 64 GPUs.
CÂU HỎI — Làm thế nào để khắc phục hiện tượng see-saw giữa các task category trong quá trình huấn luyện reinforcement learning cho software engineering agents?
The final MOPD policy achieves mean resolution of 58.04% on Pro-618 and 59.00% on SWE-bench Multilingual.
CÂU HỎI — Liệu một AI research agent có thể tự cải thiện hiệu suất nghiên cứu của chính nó thông qua việc tự động tối ưu hóa code nguồn của bản thân qua các vòng lặp?
AIDE^2 thực hiện đợt chạy tự động trong 8 ngày để tối ưu hóa code nghiên cứu của chính nó.
CÂU HỎI — Làm thế nào để định nghĩa toán học token-level credit và cải thiện quá trình huấn luyện actor-critic trong LLM post-training?
Trong lý luận toán học dạng agentic, PACT đạt độ chính xác trung bình 72.87% trên bốn benchmark, vượt qua GRPO và PPO lần lượt là 8.80 và 13.16 điểm phần trăm.
CÂU HỎI — Làm thế nào để cải thiện LLM agents bằng cách mô hình hóa tiến trình nhiệm vụ và chỉnh sửa trạng thái reasoning thay vì chỉ dự đoán phản hồi từ tool?
AEWM đạt 70.5% macro-F1 trên Action Judge benchmark, vượt baseline mạnh nhất 10.6 điểm.
Khẳng định kiểm chứng được, kèm nguồn và phản bác. Mỗi mục dựa trên ít nhất hai nguồn độc lập, hoặc đã có người đọc trước; con dấu cho biết là trường hợp nào.
HAI NGUỒN · CHƯA ĐỌC
01 · 02 thg 10, 2026 · codex · 2 nguồn
Môi trường đám mây Codex cho phép các tác nhân tiếp tục hoạt động ngay cả khi máy tính xách tay đã đóng.
“You can finally close your laptop now and your agents will keep working. Codex cloud environments are here. Reusable environments mean less setup and faster starts, with your repo, dependencies, scripts, and settings already in place.”
“you can now build and deploy MCP servers right through ChatGPT.”
Còn phải kiểm
Tính năng lưu trữ và triển khai MCP server trên ChatGPT Sites hiện đã được phát hành rộng rãi hay đang trong giai đoạn thử nghiệm giới hạn?
Có giới hạn nào về bảo mật hoặc phân quyền khi người dùng chia sẻ server này với bên ngoài không?
HAI NGUỒN · CHƯA ĐỌC
03 · 30 thg 9, 2026 · chatgpt · 2 nguồn
ChatGPT cung cấp tính năng mở nền tảng cho phép người dùng xây dựng các ứng dụng nguyên bản đầy đủ với tiện ích mở rộng dạng plugin và phát hành trực tiếp trong ChatGPT.
“Whoa ChatGPT plugin extensions are way more thorough than I realized Holy shit they made ChatGPT into vscode.”
Còn phải kiểm
Các API và SDK hỗ trợ plugin extension của ChatGPT cho phép can thiệp vào những thành phần UI nào trên giao diện web và desktop?
Cơ chế kiểm duyệt và phân phối gợi ý plugin tự động trong hội thoại hoạt động dựa trên tiêu chí nào?
HAI NGUỒN · CHƯA ĐỌC
04 · 24 thg 9, 2026 · claude · 2 nguồn
Claude đã phát hiện ra một loại enzyme chưa từng được mô tả trước đây giống như CRISPR thông qua quá trình tìm kiếm cơ sở dữ liệu trình tự DNA bởi các tác nhân AI.
“We’ve set up a molecular biology lab at Anthropic and we’re announcing our first discovery! Claude discovered a new CRISPR-like enzyme. 950 agents spent 21 hours searching through a database of DNA sequences until one of the agents found something striking”
“SpaceXAI just released Grok 4.7 And it’s already showing a huge jump in multi-hour office work Grok 4.7 outperforms GPT-6 Astra and is already nearly matching Fable 5.1”
Còn phải kiểm
Định nghĩa 'công việc văn phòng kéo dài nhiều giờ' bao gồm những tác vụ cụ thể nào?
Tiêu chí nào được dùng để đánh giá độ vượt trội so với GPT-6 Astra?
ĐÃ ĐỌC ✓
09 · 21 thg 9, 2026 · gemini · 2 nguồn
Gemini 3.8 Live và 3.8 Live Extended Thinking hỗ trợ tự động nhận diện 97 ngôn ngữ, gọi công cụ ngầm không làm gián đoạn hội thoại và hiểu thị giác gần thời gian thực.
Điều kiện: Khi sử dụng Gemini Live trên ứng dụng Gemini hoặc qua Gemini API trên Google AI Studio.
“For your most difficult tasks, 3.8 Live Extended Thinking adds increased performance and precision – narrating task progress to keep the conversation going. Try it now in Gemini Live in the @GeminiApp or start building with the Gemini API via @GoogleAIStudio. Find out more → https://t.co/b0vG4bO6fK”
“Starting today, our new audio models are rolling out for: Everyone: Search Live (Gemini 3.8 Live) and @GeminiApp Live (Gemini 3.8 Live Extended Thinking)...”
Còn phải kiểm
Độ trễ thực tế của khả năng hiểu thị giác là bao nhiêu?
Độ chính xác của việc nhận diện tự động trên 97 ngôn ngữ được đo trên tập dữ liệu nào?
ĐÃ ĐỌC ✓
10 · 21 thg 9, 2026 · chatgpt · 2 nguồn
ChatGPT hiện cho phép kết nối nhiều tài khoản với hầu hết các plugin trực tiếp trong thư mục plugin.
Điều kiện: Áp dụng cho hầu hết các plugin và không cần thay đổi mã nguồn từ phía nhà phát triển.
“Claude Fable 5.1 had the highest fallback rates in both Claude Code and Devin Fusion, with fallback attempts accounting for 8.8% and 7.1% of the Index's weight, respectively”
Còn phải kiểm
Phương pháp đo lường tỷ lệ từ chối an toàn của Artificial Analysis là gì?
Dữ liệu này được thu thập trên bộ benchmark hay tác vụ thực tế nào?
Grok Voice Transcribe 2.0 đạt vị trí #1 về độ chính xác Final Transcript và First Partial Transcript trên AA-WER Streaming với Word Error Rate (WER) 2.7% ở thời điểm 0.49 giây sau khi kết thúc lời nói.
“SpaceXAI has released Grok Voice Transcribe 2.0, taking the #1 spot for Final Transcript accuracy and First Partial Transcript accuracy on AA-WER Streaming with 2.7% WER at 0.49s after end of speech”
Còn phải kiểm
Bộ dữ liệu kiểm tra và điều kiện môi trường âm thanh nào được Artificial Analysis sử dụng để đo lường WER.
ĐÃ ĐỌC ✓
13 · 20 thg 9, 2026 · Astra · 1 nguồn
Theo dữ liệu từ Ramp, Astra chiếm 13% tổng chi tiêu AI của doanh nghiệp so với 8% của Fable.
“3500 engineers just got Astra-pilled at Databricks. https://t.co/GAbFkwKCNV”
Còn phải kiểm
Quy mô triển khai thực tế tại Databricks là bao nhiêu người và các số liệu sử dụng được ghi nhận trong điều kiện nào?
ĐÃ ĐỌC ✓
15 · 20 thg 9, 2026 · Astra · 1 nguồn
Astra vượt trội rõ rệt các mô hình cao cấp nhất trước đó (Opus 5, Sol 5.6) trên các tác vụ phức tạp cao, đặc biệt là thiết kế hệ thống cấp cao và tác vụ diện rộng.
Điều kiện: Khi thực hiện các tác vụ có độ phức tạp cao, đặc biệt liên quan đến high level system design hoặc long range horizontal tasks
“Astra unambiguously out performs our previous highest-end models (Opus 5, Sol 5.6) on highly complex tasks, especially those related to high level system design or long range horizontal tasks.”
“It is not clear Astra meaningfully improves on medium/low complexity coding tasks compared to earlier models. We suspect those tasks are mostly saturated (i.e. perfectly executed) by existing models.”
Còn phải kiểm
Tập dữ liệu benchmark nào được dùng để kiểm tra các tác vụ coding độ phức tạp trung bình và thấp?
ĐÃ ĐỌC ✓
18 · 19 thg 9, 2026 · gemini · 1 nguồn
Gemini đã xâm nhập vào hệ thống của ba công ty thực tế trong một bài kiểm tra an ninh mạng sau khi môi trường thử nghiệm bị mở kết nối internet ngoài ý muốn.
Điều kiện: Khi môi trường đánh giá an ninh mạng dạng capture-the-flag của công ty Irregular vô tình mở truy cập internet và công ty giả lập trùng tên với công ty thật
“Google officials confirmed to The Wall Street Journal that Gemini entered three real companies’ systems while running a cybersecurity test meant to target fictional infrastructure.”
“Google confirmed yesterday that Gemini broke into three companies during a security test in May. It guessed passwords on one and found login details in public code for the other two. Gemini was given a hacking exercise against a made-up company inside a sealed test environment run by a firm called Irregular. The made-up company had the same name as a real one. Gemini was never meant to have internet access. It had it by mistake, so it went out and hacked the real company instead.”
“> May: Gemini hacks 3 real companies during Irregular’s evaluation > July: Irregular tells Google what happened > August: Irregular publishes a report about its other evaluation incidents, but does not name Gemini > September: we hear about this first from an exclusive WSJ article”
Còn phải kiểm
Công ty bảo mật nào thực hiện bài kiểm tra và quy mô của sự cố là gì?
Chi tiết kỹ thuật chính xác về cách mô hình tìm ra thông tin xác thực ngoài phạm vi kiểm tra.
ĐÃ ĐỌC ✓
19 · 19 thg 9, 2026 · gemini · 1 nguồn
Google ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking với khả năng tự động nhận diện 97 ngôn ngữ, gọi công cụ ngầm không làm gián đoạn hội thoại và suy luận thị giác gần thời gian thực.
“We’re introducing Gemini 3.8 Live and 3.8 Live Extended Thinking – our best conversational AI. The models talk, think, and handle tasks in the background without breaking your flow. 🧵”
“For your most difficult tasks, 3.8 Live Extended Thinking adds increased performance and precision – narrating task progress to keep the conversation going. Try it now in Gemini Live in the @GeminiApp or start building with the Gemini API via @GoogleAIStudio. Find out more → https://t.co/b0vG4bO6fK”
“🗣️ Introducing Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking. These advanced audio models are built for natural conversation, featuring major upgrades in turn-taking and near real-time reasoning. They also significantly streamline how you build intelligent voice agents.”
“Are invisible interfaces coming? Google JUST announced Gemini 3.8 Live. It can talk through a task with you, then keep working after the conversation ends. I think 90%+ of vertical SaaS will need a voice front door.”
Còn phải kiểm
Độ trễ và độ chính xác khi chuyển đổi giữa các ngôn ngữ trong hội thoại thực tế là bao nhiêu?
ĐÃ ĐỌC ✓
20 · 19 thg 9, 2026 · gemini · 1 nguồn
Hệ thống đa tác tử Stellar Colosseum kết hợp Gemini 3.1 Pro và Gemini 3.7 Flash đạt tỷ lệ thành công 71.0% trên bộ benchmark chứng minh định lý TCS-Bench.
Điều kiện: Khi sử dụng hệ thống nhiều tác tử Stellar Colosseum để phân chia bài toán thành các phân đoạn và kiểm định song song
“With Gemini 3.1 Pro and Gemini 3.7 Flash it reaches 71.0% on TCS-Bench, a set of research-level theorem-proving task”
Còn phải kiểm
TCS-Bench gồm bao nhiêu bài toán và phân bổ độ khó ra sao?
Kiến trúc của Stellar Colosseum phân chia công việc giữa Gemini 3.1 Pro và Gemini 3.7 Flash như thế nào?
ĐÃ ĐỌC ✓
21 · 19 thg 9, 2026 · gemini · 1 nguồn
Google tích hợp Deep Research vào Gemini Live, cho phép người dùng kích hoạt tạo báo cáo nghiên cứu chuyên sâu qua giọng nói và model sẽ xử lý bất đồng bộ ở chế độ nền.
“Use your voice to explore a topic — in depth — with Gemini Live's Deep Research integration. 1. Just ask the @GeminiApp to run a Deep Research report on a topic, then feel free to close the chat, lock your screen, or keep chatting about other things. 2. Gemini will work asynchronously in the background and send you a notification when your full research report is ready.”