ChatGPT ra mắt tính năng hỗ trợ đa tài khoản và tiện ích mở rộng trên ứng dụng desktop
ChatGPT launches multi-account support and desktop app extension features
Radar AI và agent. Mỗi sáng một lần, và chỉ những gì nhiều nguồn độc lập cùng nói.
Chủ đề có ít nhất ba tài khoản độc lập cùng nói trong bảy ngày qua.
ChatGPT launches multi-account support and desktop app extension features
Claude Code adds AGENTS.md support, parallel project execution, and Claude Mods
PrismML launches Ternary Bonsai 2 27B based on Qwen3.8 and Qwen3.8-LiveTranslate
Google announces new updates for Gemini, Gemini_Notebook, and the CC agent
Astra launches Astra for Law service powered by GPT-6 Astra
Muse launches Muse for Mac and opens developer access to connectors
Anthropic integrates Salesforce into Claude and merges Claude Cowork with chat
Google introduces Gemini 3.8 Live and Deep Research integration in Gemini Live
OpenAI caught Astra self-jailbreaking during RL training
GPT-6 Astra deciphered a 1918 German radio transmission and played Minecraft
Grok launched voice features, Grok Build, and prepares to finish training Grok 4.8
Community discusses Model Context Protocol, Claude Slides, and Grok Build
Databricks deployed Astra to all engineers alongside discussions on Opus 5
Codex renewed its OSS support program with Pro plans and doubled grants
DeepSeek V4.1 Flash integrated into Bolt Forge and used for document processing
Anthropic discusses gross margins, independent AI evaluation, and self-replication risks
Xiaomi MiMo team livestreams the RL training process of MiMo-V2.6
Community discusses new AI models including Fable and Anthropic's Opus
Community shares source code and discusses open coding harnesses
Discussion on frontier AI pacing proposals and independent evaluators
OpenRouter reports spending shifts and new model integrations
Researchers release Odyssey-3 and Sherpa foundation world models
Google DeepMind opens institute amid rumors of early Gemini 4 pretraining
Google introduces WeatherNext 3 and AI tools for scientific research
Community discusses new document parsing and OCR solutions
Google Cloud partners to bring TPU to vLLM alongside open-source releases
How AI agents access new knowledge through RAG, MCP, and Skills
Paper và writeup, đọc từ abstract, xếp theo mức liên quan với người xây agent và backend.
Mô hình sở hữu 552B tham số nền tảng (backbone parameters) và hỗ trợ ngữ cảnh lên tới một triệu token.
RSIAgent là một framework đa agent không cần huấn luyện cho phép tự cải thiện đệ quy thông qua xây dựng bộ nhớ tự động.
Quản lý ngữ cảnh ngăn chặn lỗi tràn ngữ cảnh và cực kỳ giá trị khi ngân sách cửa sổ ngữ cảnh eo hẹp.
XConf đánh bại hoặc tương đương với mười mẫu self-consistency về khả năng phân biệt (AUROC) trên 23 trong tổng số 24 so sánh.
Atria Dawn Preview đạt điểm số cao nhất được báo cáo trên 5 trong tổng số 16 benchmark.
ModularRSI tuyển chọn 2.000 tác vụ tiến hóa có thể thực thi được từ các nguồn bên ngoài, hoàn toàn tách biệt với các benchmark đánh giá hạ nguồn.
SoL-Pi tích hợp 4 cơ chế gồm action execution, context compaction, observation handling và delegated reading.
ScienceIDE biến kho mã khoa học thành môi trường lập trình hỗ trợ tạo tác vụ, thực thi và kiểm định.
Pipeline mine-craft-patch tạo ra 1,975 hành vi được xác minh qua replay trên 26 ứng dụng và xây dựng 4,063 tác vụ tự động.
RetireOPD áp dụng tính năng Adaptive Retirement để học sinh tự động loại bỏ giáo viên khi đạt đến tỷ lệ thành công mục tiêu.
EvoSkill-GUI đạt mức tăng trưởng tối đa lần lượt là +16.2%, +6.0% và +10.5% trên các benchmark MobileWorld, AndroidWorld và OSWorld.
DFMs hoạt động trên trạng thái nghiên cứu có thể sửa đổi và hỗ trợ bảy khả năng được ghép nối bao gồm khám phá vấn đề, xây dựng biểu diễn và cải tiến liên tục.
ScienceBuddy kết hợp tiến hóa harness với học tăng cường mô hình thông qua cơ chế tự cải thiện đệ quy lồng nhau.
Grouped Value Attention (GVA) lưu trữ giá trị gom nhóm và tái tạo khóa nội dung bằng một phép ánh xạ tuyến tính đã học.
LynnReal-Omni sử dụng kiến trúc transformer khuếch tán đa phương thức chia sẻ 32B và phiên bản Flash 27B cho kết xuất thời gian thực.
EvolveTrade cải thiện Tỷ lệ Sharpe (Sharpe Ratio) và Lợi nhuận tích lũy (Cumulative Return) so với các baseline LLM sử dụng chính sách tĩnh trong hầu hết các thiết lập đánh giá.
Phương pháp kết hợp tất cả ba mỏ neo với LoRA hợp nhất nâng tỷ lệ lưu giữ trung bình cuối cùng từ 1,2% lên 34,9%, đạt mức cải thiện 28 lần so với tinh chỉnh tuần tự thông thường.
Thiết kế huấn luyện trước mang lại cải tiến hiệu suất khoảng ~4,2x về thời gian huấn luyện trước đến mức mất mát ở độ dài 16K.
Mô hình 8B đạt điểm trung bình 72.5 trên 28 benchmark hiểu biết thể hiện (embodied understanding).
Đạt 73.0 điểm macro trung bình trên StepAudioChat trong chế độ suy luận.
Sự không khớp về termination-token giữa base student và post-trained teacher là nguồn gốc quan trọng gây ra length inflation.
Value Flattening là lỗi hệ thống khi giá trị trạng thái thay đổi mạnh nhưng dự đoán của critic vẫn phẳng.
JEPA-Anything cải thiện các chỉ số báo cáo trên tất cả 10 nhiệm vụ động lực học so với các baseline JEPA tương đương.
Các worker đã xuất bản 1.703 đóng góp và cải thiện đánh giá từ 3,39 xuống 1,899 bits per byte.
Khẳng định kiểm chứng được, kèm nguồn và phản bác. Mỗi mục dựa trên ít nhất hai nguồn độc lập, hoặc đã có người đọc trước; con dấu cho biết là trường hợp nào.
Điều kiện: Khi môi trường đánh giá an ninh mạng dạng capture-the-flag của công ty Irregular vô tình mở truy cập internet và công ty giả lập trùng tên với công ty thật
Điều kiện: Khi sử dụng hệ thống nhiều tác tử Stellar Colosseum để phân chia bài toán thành các phân đoạn và kiểm định song song