OpenAI releases GPT-6 Sol and GPT-6 Luna alongside Tesseract video tools
OpenAI a introduit les modèles GPT-6 Sol et GPT-6 Luna, s'appuyant sur les avancées de GPT-6 Astra pour proposer des options plus rapides et abordables. L'entreprise a également lancé Tesseract, une suite de création vidéo conçue pour intégrer des agents IA directement dans les logiciels de montage.
SpaceXAI launches Grok 4.7 with high performance on the Artificial Analysis Intelligence Index
SpaceXAI a publié Grok 4.7, atteignant un score de 46 sur l'indice Artificial Analysis Intelligence et plaçant le laboratoire parmi les quatre premiers acteurs de l'IA. Le modèle améliore ses performances en matière de programmation tout en affichándose rapide et économique.
Anthropic releases Claude Opus 5.5 with 40% lower operating costs
Anthropic a présenté Claude Opus 5.5, le premier modèle de la famille Claude 5.5, offrant des performances comparables à Claude Fable 5.1 tout en réduisant les coûts d'exploitation de 40 % par rapport à Opus 5.
DigitalOcean announces public preview of Managed Agents
DigitalOcean a lancé une version publique préliminaire de Managed Agents, permettant d'exécuter des outils tels que Claude Code ou Codex dans des environnements d'exécution qui se mettent en pause lorsqu'ils sont inactifs.
NVIDIA provides accelerated computing infrastructure for Grok 4.7 and the AI ecosystem
L'infrastructure de calcul accéléré de NVIDIA continue de soutenir les modèles de l'écosystème de l'IA, notamment en alimentant Grok 4.7 de SpaceXAI pour des flux de travail complexes en programmation.
ChatGPT expands voice capabilities, multi-account plugins, and Chrome extensions
OpenAI a mis à jour les fonctionnalités vocales de ChatGPT pour intégrer des plugins de messagerie, de calendrier et de Slack. La plateforme permet désormais de connecter plusieurs comptes aux plugins et d'exécuter des extensions Chrome dans l'application de bureau.
Google launches Gemini 3.8 Flash and Flash-Lite TTS audio model family
Google a présenté Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, proposant plus de 2 000 voix prêtes pour la production et un support pour 100 langues. Cette mise à jour intègre également les capacités audio en temps réel de Gemini 3.8 Live dans la recherche.
DeepSeek advances large model development and outlines hardware training roadmap
DeepSeek entraîne actuellement des modèles de 2 et 8 billions de paramètres, tout en prévoyant d'utiliser de nouvelles puces d'entraînement Huawei d'ici fin 2026 ou début 2027. La plateforme a également intégré le modèle DeepSeek V4.1 Flash dans les outils de développement.
Muse launches Mac app integrating versatile AI agent assistant for developers
L'application Muse pour Mac a été lancée, fonctionnant à travers les fichiers, le calendrier, les notes et les messages. La plateforme a également ouvert l'accès aux connecteurs API pour les développeurs et s'est associée à Shopify pour optimiser les achats.
Google introduces Googlebook laptop line powered by Android and ChromeOS stack
Google a lancé le Googlebook, un ordinateur portable doté d'un écran tactile OLED 2.8K et de 14 heures d'autonomie. L'appareil s'appuie sur la pile technologique Android combinée aux fondations de bureau ChromeOS.
Anthropic partners with Accenture on independent evaluation and establishes biological lab
Anthropic s'est associé à Accenture pour mener des évaluations indépendantes des systèmes d'IA de pointe, investissant au moins 1 milliard de dollars. L'entreprise a également ouvert un laboratoire biologique physique à San Francisco pour la recherche expérimentale.
NVIDIA releases Nemotron 3 Diarization model for multi-speaker audio tracking
NVIDIA a publié le modèle Nemotron 3 Diarization avec 100 millions de paramètres, capable de suivre jusqu'à huit locuteurs et de gérer les voix qui se chevauchent. Le système identifie qui a parlé et à quel moment dans des transcriptions audio complexes.
Claude Code adds AGENTS.md configuration support and cloud session capabilities
Claude Code a été mis à jour vers la version 2.1.277, intégrant la prise en charge des fichiers de configuration AGENTS.md en l'absence de CLAUDE.md. Les sessions cloud sont également passées en disponibilité générale, permettant à Claude d'exécuter des threads parallèles même l'ordinateur fermé.
Introduction of the CC agent and lobbying efforts over AI regulation
Google a annoncé le lancement de CC, un agent d'intelligence artificielle conçu pour aider les familles à gérer leurs tâches logistiques et leur quotidien. Par ailleurs, des dirigeants de l'industrie technologique auraient fait pression pour faire abandonner un projet de régulation de l'IA initialement soutenu par le responsable de Google DeepMind.
Research on self-evolving ontologies and MCP integration for agents
De récentes recherches démontrent que l'intégration d'une couche d'ontologie auto-évolutive améliore considérablement les performances des agents sur les benchmarks complexes. Parallèlement, l'écosystème s'élargit avec l'adoption croissante de serveurs basés sur le protocole Model Context Protocol.
PixVerse unveils the R2 world model and the impact of harness design
PixVerse a lancé R2, un modèle du monde en temps réel permettant aux utilisateurs de contrôler et de modifier des environnements interactifs à l'aide de descriptions textuelles. Par ailleurs, des études soulignent qu'une structure de pilotage adaptée peut grandement optimiser les résultats d'un modèle sur des tâches robotiques à long terme.
Release of Ternary Bonsai 2 27B and the Qwen3.8 real-time translation model
Ternary Bonsai 2 27B a été publié, affichant une réduction de taille par rapport à sa base Qwen3.8 tout en conservant 98,2 % de ses performances sur les benchmarks. En outre, la gamme Qwen3.8 s'enrichit de LiveTranslate, un modèle de traduction simultanée en temps réel.
MiMo-V2.6-Pro leads the open weights rankings on Artificial Analysis
MiMo-V2.6-Pro s'est imposé en tête des modèles à poids ouverts sur l'indice Artificial Analysis. Reposant sur une architecture d'attention à requêtes groupées classique, il se positionne efficacement sur la frontière de Pareto entre performance et coût par tâche.
Grok 4.7 xHigh competes at the top alongside updates on Kimi K3
Grok 4.7 xHigh s'est hissé juste derrière les meilleurs modèles sur le benchmark AA-Briefcase d'Artificial Analysis. Parallèlement, des indices annoncent l'arrivée imminente de Kimi K3.1, tandis que de nouvelles démonstrations illustrent l'exécution de grands modèles sur du matériel local minimal.
Discussions on automated AI research and multi-agent systems
La communauté a débattu du potentiel d'automatisation de la recherche scientifique grâce à des systèmes multi-agents. Les échanges ont porté sur les perspectives et les implications d'une superintelligence capable de piloter des avancées autonomes en mathématiques et en ingénierie.
Optimizing inference systems and accelerating execution for large language models
Zhipu a indiqué que GLM-5.3-Flash fonctionne sur plus de 10 000 accélérateurs d'IA domestiques, atteignant une augmentation de 3,2 fois du débit grâce à une optimisation automatisée pilotée par un agent IA. Parallèlement, des modèles tels que DiffusionGemma et Ternary-Bonsai ont reçu des intégrations dans les environnements vLLM et MLX.
DeepSeek trials large-scale server infrastructure and Xiaomi launches MiMo-V2.6
DeepSeek exploite des unités de production d'environ 160 nœuds, desservant environ 3 millions de bacs à sable par jour. Au même moment, Xiaomi a publié la série MiMo-V2.6 comprenant des modèles Pro et Flash, la variante Pro obtenant 46 points sur Artificial Analysis.
Running local open-weight models on constrained hardware devices
Des développeurs ont déployé un modèle ternaire de 27 milliards de paramètres à 1,72 bit par poids sur une seule carte graphique dotée de 12 Go de VRAM. De plus, des mises à jour ont intégré les noyaux Metal de llama.cpp dans transformers et ajouté le support de SGLang pour les modèles de génération d'images.
Alibaba announces large-scale AI infrastructure plans and RecreationWorld sandbox
Alibaba a ciblé 20 gigawatts de capacité mondiale de centres de données d'ici 2032, parallèlement à des projets pour une série de modèles Qwen de 5 à 10 billions de paramètres. L'équipe Qwen a également publié RecreationWorld, un environnement de test à cinq plates-formes pour les agents d'utilisation d'ordinateurs.
Improving skill optimization methods for AI agents
Des chercheurs ont présenté une méthode permettant aux agents IA d'améliorer les invites de compétences en classant les candidats, réduisant ainsi les coûts de jetons de 40 % à 70 % par rapport aux méthodes conventionnelles. NVIDIA a également détaillé une approche pour compiler des compétences d'agents publics en environnements d'apprentissage par renforcement.
Evaluating safety refusal rates on coding agent benchmarks
Artificial Analysis a introduit le signalement des refus de sécurité dans la version 1.5 de son indice d'agents de codage pour aider à expliquer les différences de comportement des modèles. Les données ont montré des variations distinctes des taux de refus de sécurité entre les modèles évalués lors des tâches de programmation.
Automated learning applications and improved retrieval methods for finance
Une étude universitaire conjointe a présenté une voie permettant aux agents financiers d'apprendre des erreurs de dépôt auprès de la SEC en exigeant que tout nouveau comportement réussisse d'abord des tests de régression. De nouveaux cadres de récupération adaptatifs ont également été publiés pour mieux traiter des requêtes de données spécifiques.
QUESTION — Comment concevoir un système d'interaction full-duplex qui intègre perception continue, contrôle conversationnel et exécution asynchrone de tâches de fond à l'aide de modèles de 9B?
Realtime-Venus-Omni obtient les scores les plus élevés sur six des huit benchmarks vidéo, notamment StreamingBench (70,2%), OVO-Bench (64,7%) et Daily-Omni (81,3%).
QUESTION — Comment convertir et découper des formats de documents d'entreprise hétérogènes (PDF, Word, scans) en Markdown optimisé pour la recherche tout en réduisant les coûts de tokens et le temps de traitement?
Sur le sous-ensemble de test de 236 documents et 795 pages PDF, D-RAC convertit et découpe l'ensemble du corpus en 72 minutes sans aucune erreur, produisant 1 748 blocs prêts pour la recherche.
QUESTION — Comment optimiser la gestion de la mémoire pour les agents LLM en reportant le processus de synthèse du moment de l'écriture au moment de la lecture ?
Sur ALFWorld, WebShop et τ^2-bench, JitMem surpasse la référence la plus forte de 16,2, 16,3 et 3,9 points de taux de réussite absolus, respectivement.
QUESTION — Comment pouvons-nous surmonter l'effet de bascule entre catégories lors de l'apprentissage par renforcement pour les agents de génie logiciel ?
The final MOPD policy achieves mean resolution of 58.04% on Pro-618 and 59.00% on SWE-bench Multilingual.
QUESTION — Comment définir mathématiquement le crédit au niveau du jeton et l'exploiter pour améliorer l'entraînement acteur-critique dans le post-entraînement des LLM ?
En matière de raisonnement mathématique agentique, PACT atteint une précision moyenne de 72,87 % sur quatre benchmarks, surpassant GRPO et PPO de 8,80 et 13,16 points de pourcentage.
QUESTION — Comment fournir une mémoire épisodique à long terme aux modèles Vision-Language-Action sans alourdir le contexte ni augmenter la latence d'inférence ?
MemBodied atteint 7,81 fois le taux de réussite moyen d'une politique sans état et 2,98 fois celui d'une mémoire récurrente de base à travers cinq tâches RMBench évaluées.
QUESTION — Comment mesurer et améliorer la capacité de prise de décision stratégique à long terme (taste) des agents LLM dans les tâches d'ingénierie et de recherche?
Le meilleur modèle ne répond correctement qu'à 59,7% des questions sur Taste-Bench.
QUESTION — Comment un juge basé uniquement sur la décision peut-il réduire le coût d'inférence de LLM-as-a-judge tout en préservant la précision de l'évaluation ?
JEV is within three percentage points of a state-of-the-art LLM judge on ordinary preference and evidence-grounded factuality at 0.36% of the comparator's fee.
QUESTION — Quelle est la cause de l'instabilité d'entraînement dans l'apprentissage par renforcement FP8 en pipeline complet pour les LLM, et comment y remédier ?
Le bruit de quantification FP8 cumulé fausse le rapport d'importance, poussant les jetons à avantage négatif hors de la région de confiance et annulant leurs gradients.
QUESTION — Comment distiller les représentations du monde physique d'un modèle du monde dans des politiques Vision-Language-Action compactes sans ajouter de latence d'inférence à l'exécution ?
La politique déployée s'exécute en 32 ms et 1,86 Go sur une RTX 5090 grand public, identique à la base non distillée.
QUESTION — Comment pouvons-nous construire une famille de plongements omnimodaux universels prenant en charge le texte, l'image, la vidéo et l'audio dans un espace de représentation partagé ?
Ovis-Embedding achieves state-of-the-art performance on MMEB-v3, MMEB-v2, MVEB, MAEB, and RTEB.
QUESTION — Comment améliorer la précision de l'estimation du gradient lors de l'attribution d'une supervision clairsemée par l'enseignant pendant la distillation sur politique (on-policy) ?
Sparse configurations matching or exceeding full OPD without token selection at small token budgets of 0.1%--1%.
QUESTION — Comment appliquer efficacement le réglage par apprentissage par renforcement à des tâches de manipulation à long terme dans le monde réel avec un minimum d'intervention humaine ?
Sur les tâches bimanual YAM et single-arm Franka, PARTS améliore le succès des tâches complètes de 32 % à 61 % et de 50 % à 95 %, respectivement.
QUESTION — Comment optimiser les politiques d'apprentissage par renforcement pour la génération de code SVG ouverte sans dépendre de données de référence ou d'étiquettes de préférence humaine?
L'utilisation d'un juge vision-langage avec une grille multi-axe corrèle beaucoup mieux avec les jugements humains que les métriques scalaires.
QUESTION — Quels mécanismes de mémoire préservent la persistance temporelle et l'information historique dans la génération vidéo autorégressive sous des limites de contexte restreintes ?
Cet article présente une revue systématique et complète des mécanismes de mémoire dans la génération vidéo autorégressive (AR). À mesure que les séquences générées s'allongent, les modèles font face à des contraintes strictes sur les fenêtres de contexte, le stockage et le calcul, entraînant la perte d'informations historiques critiques. Les auteurs formulent la mémoire de manière opérationnelle comme des informations historiques persistantes maintenues à travers les étapes AR externes pour influencer la génération future. La littérature est organisée selon cinq perspectives complémentaires : Formes, Fonctions, Opérations, Apprentissage et Évaluation.
QUESTION — Comment éliminer la dérive scalaire dans les modèles de récompense vidéo ?
RewardVerse introduit une grille d'évaluation dynamique comme représentation intermédiaire entre la requête d'évaluation et le scoreur pour atténuer la dérive scalaire.
QUESTION — Comment générer automatiquement des actifs déformables pour la manipulation robotique à partir de texte ou d'une seule image à l'aide d'un système agentique ?
DeformSmith génère des actifs avec une meilleure qualité visuelle et une plausibilité physique supérieure aux références de l'état de l'art, notamment PhysGen3D, PhysGM et PhysX-Omni.
QUESTION — Comment développer, entraîner et évaluer des MLLM pour l'emballage robotique en boucle fermée et à long horizon ?
PackLab-VLM surpasse les heuristiques d'emballage conventionnelles, les méthodes d'apprentissage par renforcement traditionnelles et les MLLM à usage général à travers divers ensembles d'objets et configurations de conteneurs.
QUESTION — Comment pouvons-nous évaluer de manière exhaustive la cohérence et la réactivité des modèles du monde lorsque les agents interagissent et explorent ?
Spatial models achieve at best 70.14% placement accuracy and 73.33% edit execution.
QUESTION — Comment construire un espace latent géométrique natif pour améliorer la cohérence 3D et la qualité visuelle dans la génération de mondes?
Le remplacement de l'espace latent par GAE améliore la qualité visuelle et la cohérence 3D mesurée indépendamment : la FVD chute de 12,7% et 23,1% sur RealEstate10K et DL3DV.
Affirmations vérifiables, avec leurs sources et leurs contradictions. Chacune tient sur au moins deux sources indépendantes, ou a été relue par un humain ; le tampon dit lequel.
DEUX SOURCES · NON RELU
01 · 24 sept. 2026 · claude · 2 sources
Claude a découvert un système enzymatique non caractérisé auparavant présentant des caractéristiques rappelant CRISPR après que des agents IA ont parcouru une base de données de séquences d'ADN.
Condition: Avec 950 agents s'exécutant sur 21 heures.
« We’ve set up a molecular biology lab at Anthropic and we’re announcing our first discovery! Claude discovered a new CRISPR-like enzyme. 950 agents spent 21 hours searching through a database of DNA sequences until one of the agents found something striking »