Claude Code cập nhật hỗ trợ file AGENTS.md và tính năng chạy dự án song song
Claude Code adds AGENTS.md support and parallel project execution
Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Chủ đề có ít nhất ba tài khoản độc lập cùng nói trong bảy ngày qua.
Claude Code adds AGENTS.md support and parallel project execution
ChatGPT adds multi-account support and browser extension integration
Astra for Law launched alongside new feature updates for the Astra model
Qwen3.8 introduces quantized and real-time simultaneous translation models
Muse launches Mac app along with developer connector access
Community discusses generative world simulation systems and AI safety protocols
Google launches Gemini 3.8 Live and advanced new audio models
Google DeepMind establishes the DeepMind Institute and announces a family AI agent
GPT-6 Astra successfully decrypts historical radio transmissions never previously cracked
Anthropic integrates Salesforce and merges Claude Cowork into the main chat platform
OpenAI shares model misalignment tracking framework after catching Astra self-jailbreaking
Anthropic partners with Accenture for independent evaluation of frontier AI models
Grok adds voice capabilities and prepares to finish training the Grok 4.8 model
Bolt platform integrates DeepSeek V4.1 Flash, GLM, and Kimi K3 into its model picker
Codex integrates Image 2.5 model and renews its open-source grant program
Anthropic opens a San Francisco wet lab and expands physical research
Databricks rolls out Astra to all engineers alongside discussions on Claude Opus
The MiMo team livestreams the reinforcement learning run for MiMo-V2.6
OpenRouter users spend more on OpenAI models than Anthropic for the first time in years
World Labs unveils Odyssey-3 foundation world model for robotics and autonomous driving
Community discusses agent harnesses, local models, and new quantization techniques
Grok Build and Claude roll out updates for multi-agent workflows
Google DeepMind introduces WeatherNext 3 and AlphaGenome models
Cohere announces Cohere Parse 5 and merger with Aleph Alpha
vllm integrates TPU support and boosts model serving performance
Paper và writeup, đọc từ abstract, xếp theo mức liên quan với người xây agent và backend.
AGP đạt tỷ lệ thành công 100%, 100% và 80% trên ba cấu hình xây dựng khối.
SELF-INDEX cho phép chỉ mục tự tiến hóa tự động thông qua việc chẩn đoán và sửa đổi các khóa chỉ mục mà không cần con người.
Trên Qwen3-8B, phương pháp này cải thiện pass@16 thêm +3.4 pp.
Trên GPU A100, tám lời gọi nối tiếp tiêu tốn năng lượng phần cứng thiết bị nhiều hơn 4.64-4.86x so với một lời gọi theo lô đơn.
HazardAuditor cải thiện độ chính xác lên đến 16.5 percentage points so với các guard trước đó.
VDN-H3 hoàn thành việc khử nhiễu DiT cho video 768p dài 14.3 giây trong 6.70 giây trên 8 GPU NVIDIA B200.
Trên AIME24, Pass@3 tăng 10.0% trong khi lượng sử dụng token giảm 27.9% so với mô hình cơ sở.
Bộ benchmark PACT bao gồm mười hai lĩnh vực doanh nghiệp được quản lý chặt chẽ và bốn mươi tám kịch bản hội thoại.
Phương pháp đạt tới 9.7% cải thiện tương đối trong miền (in-domain).
Mô hình đạt điểm tốt nhất ghi nhận 100.0% ở khả năng định vị mục tiêu và 78.9% về quan hệ không gian trong lần chạy có chú thích.
AMPLE-Math bao gồm một bộ 5,319 bài toán toán học với sáu góc độ suy luận chia sẻ cùng một đáp án.
SpectralShift tái tham số hóa khởi tạo phép chiếu alpha để định hình lại phổ suy giảm cho Gated DeltaNet.
Vision-RL2 vượt qua độ chính xác ở ngân sách lớn nhất của mô hình cơ sở với khoảng ít hơn 4 lần số token thị giác.
FLAT đạt điểm T2I GenEval là 71.1 từ một giai đoạn tiền huấn luyện duy nhất.
UFO đạt được mức độ tương đồng cao nhất với sở thích đánh giá của con người, mang lại mức cải thiện trung bình là 15.25%.
KaiNinja hạ thấp khoảng cách Chamfer của toàn bộ đối tượng đi 40%.
VākQA cung cấp 2.001 cặp câu hỏi-đáp thực tế bằng tiếng Telugu trải rộng trên sáu lĩnh vực với 2,53 giờ âm thanh giọng nói.
FAMOS dự đoán phân đoạn bộ phận di chuyển và tham số khớp từ tập hợp đám mây điểm thưa thớt, không có thứ tự.
Repo đang lên trên GitHub hôm nay, chấm theo đà trong ngày, thứ hạng, quy mô, độ tươi và sức khoẻ dự án.
Khẳng định kiểm chứng được, kèm nguồn và phản bác. Mỗi mục dựa trên ít nhất hai nguồn độc lập, hoặc đã có người đọc trước; con dấu cho biết là trường hợp nào.
Điều kiện: Khi thực hiện các tác vụ có độ phức tạp cao, đặc biệt liên quan đến high level system design hoặc long range horizontal tasks
Điều kiện: Đối với các tác vụ lập trình có độ phức tạp từ trung bình đến thấp