Claude Code prend en charge les fichiers AGENTS.md et l'exécution de projets parallèles
Claude Code adds AGENTS.md support and parallel project execution
Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.
Sujets repris par au moins trois comptes indépendants sur les sept derniers jours.
Claude Code adds AGENTS.md support and parallel project execution
ChatGPT adds multi-account support and browser extension integration
Astra for Law launched alongside new feature updates for the Astra model
Qwen3.8 introduces quantized and real-time simultaneous translation models
Muse launches Mac app along with developer connector access
Community discusses generative world simulation systems and AI safety protocols
Google launches Gemini 3.8 Live and advanced new audio models
Google DeepMind establishes the DeepMind Institute and announces a family AI agent
GPT-6 Astra successfully decrypts historical radio transmissions never previously cracked
Anthropic integrates Salesforce and merges Claude Cowork into the main chat platform
OpenAI shares model misalignment tracking framework after catching Astra self-jailbreaking
Anthropic partners with Accenture for independent evaluation of frontier AI models
Grok adds voice capabilities and prepares to finish training the Grok 4.8 model
Bolt platform integrates DeepSeek V4.1 Flash, GLM, and Kimi K3 into its model picker
Codex integrates Image 2.5 model and renews its open-source grant program
Anthropic opens a San Francisco wet lab and expands physical research
Databricks rolls out Astra to all engineers alongside discussions on Claude Opus
The MiMo team livestreams the reinforcement learning run for MiMo-V2.6
OpenRouter users spend more on OpenAI models than Anthropic for the first time in years
World Labs unveils Odyssey-3 foundation world model for robotics and autonomous driving
Community discusses agent harnesses, local models, and new quantization techniques
Grok Build and Claude roll out updates for multi-agent workflows
Google DeepMind introduces WeatherNext 3 and AlphaGenome models
Cohere announces Cohere Parse 5 and merger with Aleph Alpha
vllm integrates TPU support and boosts model serving performance
Articles et papiers, lus depuis leur résumé, classés par pertinence pour qui construit des agents et du backend.
AGP atteint des taux de réussite de 100%, 100% et 80% sur trois configurations de construction de blocs.
SELF-INDEX permet à un index de s'auto-évoluer sans intervention humaine grâce au diagnostic autonome et à la révision des clés par son optimiseur.
Sur Qwen3-8B, il échange une certaine fiabilité de pass@1 contre un pass@k plus élevé (+3,4 pp au pass@16) et résout des tâches plus distinctes.
Sur les GPU A100, huit appels séquentiels consomment 4.64-4.86x plus d'énergie globale de l'appareil GPU qu'un seul appel groupé avec huit candidats.
HazardAuditor améliore la précision jusqu'à 16.5 percentage points par rapport au garde antérieur le plus puissant.
VDN-H3 réalise le débruitage DiT pour une vidéo 768p de 14.3 secondes en 6.70 secondes sur huit GPU NVIDIA B200.
Sur AIME24, le Pass@3 augmente de 10.0% tandis que l'utilisation des tokens est réduite de 27.9% par rapport au modèle de base.
Le banc d'essai PACT couvre douze domaines d'entreprise réglementés et quarante-huit scénarios de conversation.
Il atteint jusqu'à 9.7% d'amélioration relative dans le domaine.
Le modèle le plus performant obtient 100.0% sur la localisation des cibles et 78.9% sur les relations spatiales lors de l'exécution annotée.
AMPLE-Math est une suite réutilisable de 5 319 problèmes mathématiques avec six vues de raisonnement partageant la même réponse.
SpectralShift reparamètre l'initialisation des projections alpha pour remodeler le spectre de décroissance pour Gated DeltaNet.
Vision-RL2 améliore la précision par rapport au modèle de base à chaque budget de jetons et dépasse sa précision au plus grand budget avec environ 4 fois moins de jetons visuels.
FLAT atteint un score T2I GenEval de 71.1.
UFO atteint la corrélation la plus élevée avec les préférences d'évaluation humaines, offrant une amélioration moyenne de 15.25%.
Il réduit la distance de Chamfer de l'objet entier de 40%.
VākQA fournit 2 001 paires question-réponse factuelles sur six domaines avec 2,53 heures d'audio en Telugu.
FAMOS prédit la segmentation des pièces mobiles et les paramètres d'articulation à partir d'un ensemble clairsemé et non ordonné de nuages de points partiels.
Dépôts qui montent sur GitHub aujourd'hui, notés sur l'élan du jour, le rang, l'adoption, la fraîcheur et la santé du projet.
Affirmations vérifiables, avec leurs sources et leurs contradictions. Chacune tient sur au moins deux sources indépendantes, ou a été relue par un humain ; le tampon dit lequel.
Condition: Khi thực hiện các tác vụ có độ phức tạp cao, đặc biệt liên quan đến high level system design hoặc long range horizontal tasks
Condition: en supposant que ces tâches sont principalement saturées par les modèles existants