Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.
Synthèse du jourécrite par le modèle
01Xiaomi MiMo-V2.6 intègre OpenRouter et vLLMLa série de modèles MiMo-V2.6 de Xiaomi dotée d'une fenêtre de contexte de 1M de tokens est désormais disponible sur OpenRouter et vLLM.→ 2023
02OpenAI et Anthropic déploient de nouvelles familles de…OpenAI et Anthropic ont toutes deux introduit de nouvelles gammes de modèles accompagnées de coûts d'exploitation réduits par rapport à leurs versions précédentes.→ 0912
03Google teste des processeurs TPU en orbite spatialeGoogle a déployé des prototypes de satellites transportant des processeurs Tensor pour évaluer des charges de travail en orbite spatiale.→ 0217
Vidéo du jour
bobine n° 1 · 1:17
ÉTIQUETTEarchitecture · 22 voix
Anthropic lance Claude Opus 5.5 avec des coûts d'exploitation réduits de 40 %
Anthropic a présenté Claude Opus 5.5, le premier modèle de la famille Claude 5.5, offrant des performances comparables à celles de Claude Fable 5.1 pour un coût d'exploitation inférieur de 40 % à celui d'Opus 5. Le modèle améliore la clarté des communications et l'efficacité des jetons à tous les niveaux d'effort.
Claude Code updates cloud sessions and usage limits
Claude Code a officialisé les sessions cloud permettant de maintenir les tâches en arrière-plan et a introduit un point d'arrêt progressif lors de l'atteinte de la limite de cinq heures. L'outil a également rétabli la facturation des requêtes bloquées par les filtres de sécurité.
Google tests TPUs in space and publishes new DeepMind essays
Le projet Suncatcher de Google teste un prototype de satellite équipé de TPU lors d'une mission de SpaceX. Par ailleurs, Google DeepMind a publié des essais sur le contrôle des comportements dans les essaims d'agents et la répartition équitable des bénéfices de l'AGI.
Hugging Face reviews internet access for AI agents during evaluation
Hugging Face mène un examen approfondi de l'utilisation d'Internet par ses agents lors de l'entraînement et de l'évaluation, tout en publiant des rapports de transparence. Parallèlement, de nouveaux modèles de diarisation ont été lancés pour identifier les locuteurs.
ChatGPT Voice integrates plugins and expands pricing tiers
ChatGPT Voice intègre désormais des plugins pour les e-mails, le calendrier et Slack sur le web et mobile. L'écosystème se prépare également à introduire de nouvelles formules d'abonnement s'étageant jusqu'à une offre Pro Max à 500 dollars.
Google introduces Gemini 3.8 Flash TTS and Flash-Lite TTS
Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, offrant plus de 2 000 voix prêtes pour la production, un support pour 100 langues, ainsi que des outils de conception et de clonage vocal.
Microsoft announces major GitHub Copilot update with Autopilot and GPT-6 models
Microsoft a dévoilé une mise à jour majeure de GitHub Copilot intégrant Autopilot ainsi que les nouveaux modèles GPT-6 Sol et GPT-6 Luna. Cette version introduit également une nouvelle application Copilot dotée de modes Home, Code et Copilot.
DigitalOcean launches Managed Agents in public preview
DigitalOcean a lancé les Managed Agents en version préliminaire publique, permettant aux utilisateurs d'exécuter Claude Code, Codex ou des agents LangGraph dans des environnements d'exécution qui se mettent en pause lorsqu'ils sont inactifs. Le service regroupe les outils sous un point de terminaison géré et prend en charge plus de 75 options open source.
Grok 4.7 xHigh scores 58% on Artificial Analysis AA-Briefcase benchmark
Grok 4.7 xHigh a atteint 58 % sur le benchmark AA-Briefcase d'Artificial Analysis, se classant juste un point derrière Claude Fable 5.1 Max à 59 %. Par ailleurs, le modèle furtif Pixel Canary a été lancé sur Cline, à égalité avec GPT-6 Astra et surpassant Kimi K3 sur le benchmark Next.js Agent Evals.
OpenAI a lancé GPT-6 Sol et GPT-6 Luna, intégrant les points forts de GPT-6 Astra dans des modèles plus rapides et plus abordables pour répondre aux besoins de production à grande échelle. Les deux modèles sont lancés avec des tarifs d'API inférieurs de 50 % à ceux de GPT-5.6, parallèlement à Tesseract, une suite de création vidéo conçue pour les agents IA.
Meta announces new features and integration partners for Muse at Connect
Lors de la conférence Connect, Meta a annoncé des partenariats d'intégration stratégiques pour son agent personnel IA Muse avec Shopify, Expedia et PayPal. Ces collaborations permettent aux utilisateurs de simplifier leurs achats, la planification de voyages et le paiement via l'agent Muse auprès de marchands du monde entier.
Anthropic launches plugin submission portal and expands MCP integration
Anthropic a lancé un nouveau portail permettant aux développeurs de soumettre des plugins, de suivre les examens et de surveiller l'utilisation pour Claude. Ces plugins regroupent le Model Context Protocol (MCP) et des compétences personnalisées, constituant la méthode standard pour développer sur Claude.
Anthropic launches Claude Opus 5.5 with 40% lower operational costs
Anthropic a présenté Claude Opus 5.5, le premier modèle de la famille Claude 5.5, offrant des performances comparables à celles de Claude Fable 5.1 pour un coût d'exploitation inférieur de 40 % à celui d'Opus 5. Le modèle améliore la clarté des communications et l'efficacité des jetons à tous les niveaux d'effort.
Claude Sonnet 5.5 spotted in stealth testing with a 1M-token context window
Claude Sonnet 5.5 fait actuellement l'objet de tests furtifs avec une fenêtre de contexte de 1 million de jetons et une sortie maximale de 128 000 jetons. La tarification est fixée à 2 dollars par million de jetons en entrée et 10 dollars en sortie, perçue comme une réponse directe aux lancements concurrents.
Anthropic speeds up Claude.ai performance by 3x in two weeks
Anthropic a multiplié par trois la vitesse d'exécution de claude.ai et de son application de bureau en l'espace de deux semaines. L'équipe de développement a partagé les méthodes et les instructions précises employées avec Claude pour mesurer, déboguer et optimiser les performances.
Grok 4.7 launches with support from NVIDIA accelerated computing
SpaceXAI a publié Grok 4.7, présenté comme son modèle le plus performant à ce jour pour la programmation et le travail intellectuel. Ce système a bénéficié du soutien des infrastructures de calcul accéléré de NVIDIA.
Sakana AI appoints Jürgen Schmidhuber as Chief Scientific Advisor
Jürgen Schmidhuber, pionnier du méta-apprentissage, de l'auto-amélioration récursive et des modèles du monde dès les années 1990, a rejoint Sakana AI en tant que conseiller scientifique en chef. Parallèlement, l'entreprise a présenté Agora-2, un modèle du monde multi-agents de nouvelle génération permettant l'interaction en temps réel de vingt humains et agents.
Google launches a satellite to test TPU performance in orbit
Google s'est associé à Planet pour placer en orbite un satellite prototype équipé de quatre processeurs Tensor (TPU). Cette mission vise à évaluer la résistance de ce matériel face aux conditions spatiales extrêmes afin d'étudier la faisabilité d'exécuter des charges de travail d'apprentissage automatique en orbite.
Apple releases a Qwen3.5-9B finetune converting documents into images
Apple a mis en ligne sur Hugging Face un modèle affiné à partir de Qwen3.5-9B, capable de convertir des documents volumineux en images de pages miniatures afin d'économiser des jetons, avant de récupérer le texte intégral des seules pages pertinentes pour la requête.
Agent harnesses integrate System One models and Contrastive Language Model
La communauté des développeurs d'agents expérimente des modèles System One tels que Jev et le Contrastive Language Model au sein de leurs architectures personnalisées. Ces modèles servent de routeurs ou de vérificateurs rapides pour améliorer l'efficacité des tâches d'agents.
Xiaomi MiMo-V2.6 and System One model Jev launch on OpenRouter
OpenRouter a intégré plusieurs nouveaux modèles, dont la série multimodale MiMo-V2.6 de Xiaomi dotée d'une fenêtre contextuelle de 1M de tokens ainsi que le modèle System One Jev. Les développeurs testent ces architectures pour des applications à faible latence.
Xiaomi MiMo-V2.6-Pro tops open weights model benchmarks
Le modèle MiMo-V2.6-Pro s'est hissé à la première place de l'Artificial Analysis Intelligence Index pour les modèles à poids ouverts. Il utilise une architecture classique de type Grouped Query Attention et offre une efficacité par tâche compétitive.
New research explores distillation and reinforcement learning for agents
Des chercheurs ont présenté une approche de post-entraînement permettant aux agents d'apprendre à partir de sessions utilisateur réelles en imitant les bonnes trajectoires et en corrigeant les erreurs. Une autre étude de Google évalue l'impact de la distillation des architectures d'agents sur les taux de réussite.
vLLM adds day-one support for Xiaomi MiMo-V2.6 and DiffusionGemma-Jev
Le framework vLLM déploie un support immédiat pour les modèles MiMo-V2.6 de Xiaomi ainsi que DiffusionGemma-Jev. Les variantes Pro et Flash bénéficient ainsi de capacités de traitement multimodal et de contextes étendus sur la plateforme d'inférence.
Tencent ARC Lab releases GameHorizon Suite for evaluating game agents
Le laboratoire ARC de Tencent a introduit la suite GameHorizon, un ensemble de données et d'évaluation conçu pour mesurer les capacités de jeu AAA sur plusieurs horizons temporels pour les modèles multimodaux et les agents logiciels.
Anthropic hackathon winner open-sources complete Claude Code setup
Le vainqueur du hackathon d'Anthropic a publié en open source l'intégralité de sa configuration Claude Code, comprenant des compétences d'agents, des plugins et des astuces pratiques. Parallèlement, de nouvelles recherches présentent des méthodes pour faire évoluer les compétences des agents avec une réduction de 40 à 70 pour cent des coûts en jetons par rapport aux méthodes de pointe, aux côtés des travaux de NVIDIA transformant les compétences d'agents publics en environnements d'apprentissage par renforcement.
Alibaba announces infrastructure plans and next-generation Qwen models
Alibaba vise à atteindre 20 gigawatts de capacité de centres de données mondiaux d'ici 2032 pour soutenir ses ambitions en matière d'intelligence artificielle générale, ainsi que des projets de modèle Qwen de 5 à 10 billions de paramètres et de puces IA maison. De plus, l'équipe Qwen a publié RecreationWorld sur Hugging Face, un bac à sable permettant aux agents informatiques hybrides d'explorer, de mettre en œuvre et de vérifier visuellement leurs créations.
QUESTION — Comment améliorer les agents LLM en modélisant la progression des tâches et en éditant les états de raisonnement plutôt qu'en prédisant les réponses des outils ?
AEWM atteint 70,5% de macro-F1 sur notre benchmark Action Judge, dépassant la baseline de frontière la plus forte de 10,6 points.
QUESTION — Comment concevoir un agent conversationnel incarné capable de jouer aux côtés de joueurs humains dans des jeux en temps réel sous des contraintes strictes de latence?
Collecte de données sur près de 39 000 sessions où de vrais joueurs jouent aux côtés d'Ally pour un entraînement itératif.
QUESTION — Comment améliorer la généralisation de la génération visuelle dans les MLLM et les systèmes multi-agents sans ajuster les poids du modèle?
OmniHarness atteint un taux de résolution de 95,0% sur les tâches créatives de ComfyBench, dépassant la référence la plus forte de 27,5 points de pourcentage.
QUESTION — Les agents de codage peuvent-ils automatiser la synthèse de programmes pour résoudre des problèmes généralisés de planification de tâches et de mouvements (TAMP) ?
À travers toutes les méthodes de synthèse de programmes, nous évaluons 980 programmes générés sur 100 instances de test chacun, soit 98 000 épisodes d'évaluation au total.
QUESTION — Comment intégrer des modèles vision-langage (VLM) dans un espace de travail d'action visuelle pour piloter plus efficacement la manipulation robotique ?
Sur LIBERO-Pro, WAA avec des compétences évoluées uniquement à partir de LIBERO-90 atteint un succès moyen de pointe de 75,6 %, surpassant les VLA de bout en bout, les agents code-as-policy et une base de référence visuelle avec le même squelette.
QUESTION — Comment générer automatiquement des tâches de cas limites pour évaluer et optimiser les agents d'appel d'outils sans annotation humaine ?
Le fine-tuning sur les données générées par EdgeGen produit une amélioration constante de la progression moyenne de 2 pour cent à 42 pour cent sur le domaine aérien tau2bench, tandis que d'autres méthodes de référence montrent une dégradation pour certains modèles.
QUESTION — Comment éliminer la duplication sémantique dans la génération de texte par LLM lors de l'échantillonnage par température sans perdre en précision ?
FLEET atteint la même précision que la référence d'échantillonnage répété, avec une accélération de 3x.
QUESTION — Comment les systèmes multi-agents à long horizon se comportent-ils face à des événements de stress contradictoires lors d'une opération persistante?
Les agents ont généré plus de 850 000 appels LLM et près de 50 milliards de jetons sur 16 jours dans huit mondes parallèles.
QUESTION — Comment améliorer simultanément la précision du raisonnement et l'efficacité de l'inférence dans les modèles de langage en combinant des capacités apprises indépendamment ?
On Qwen3.5-4B, it raises HMMT 2025 accuracy from 59.2% to 64.0% with 10.7% fewer response tokens, and LiveCodeBench v5 accuracy from 41.7% to 54.2% with 9.6% fewer response tokens.
QUESTION — Comment des équipes d'agents IA peuvent-elles s'auto-organiser pour apprendre des stratégies de raisonnement collaboratif et résoudre des problèmes dépassant les capacités individuelles?
Sur cinq benchmarks de mathématiques et de physique, les équipes auto-organisées obtiennent une précision moyenne de 66,7 %, contre 48,8 % pour leur membre le plus fort.
QUESTION — Comment extraire et caractériser les traces de chaînes de pensée cachées des modèles de langage de pointe fermés via une API standard ?
Cette recherche exploite un outil personnalisé simple enregistré via une fonction d'API standard pour inciter les modèles de pointe à externaliser leur raisonnement intermédiaire qui est par ailleurs caché dans les systèmes fermés. En comparant avec le CoT natif sur des modèles ouverts et en l'étendant à des systèmes tels que GPT-6 Astra, les auteurs démontrent que le raisonnement extrait égale les performances du raisonnement natif et surpasse substantiellement les baselines sans raisonnement en mathématiques de compétition, en science et en génération de code. L'analyse structurelle révèle que des modèles comme Astra présentent un raisonnement dirigé efficace en jetons, résolvant les étapes élémentaires en interne tout en externalisant uniquement le raisonnement crucial.
QUESTION — Comment résoudre l'enchevêtrement des signaux d'apprentissage dans l'optimisation par renforcement pour la génération conjointe audio-vidéo ?
AV-GRPO surpasse LTX-2.3 en termes de qualité de génération, d'alignement sémantique et de synchronisation inter-modale sous LoRA et fine-tuning complet.
QUESTION — Comment améliorer l'efficacité et la latence des modèles monde-action pour le contrôle de robots bimanuels ?
DeltaWAM avec SDM améliore le taux de réussite moyen par rapport à Fast-WAM de 81,3 % à 85,4 % dans le cadre propre et de 75,8 % à 83,9 % sous randomisation visuelle.
QUESTION — Peut-on éliminer complètement la pile teacher-critic gourmande en ressources lors du post-entraînement de génération vidéo ?
With only 20 generator updates, the recipe reaches 84.87 on the official VBench evaluation, outperforming the previous best few-step causal baseline by 0.36, while requiring 16 A100 GPU-hours.
QUESTION — Comment améliorer la structure intermédiaire et la supervision dans la planification de tâches à long horizon pour les systèmes Vision-Language-Action ?
L'évaluation de la planification hors ligne en deux étapes place X-Planner en deuxième position parmi quatre modèles évalués sur le BERTScore-F1 et le score global basé sur un juge.
QUESTION — Comment améliorer l'expressivité des RNN linéaires basés sur la règle delta en combinant des extensions de plages de paramètres pour les rotations et les réflexions ?
Chaque matrice orthogonale diagonale plus de rang un est exactement une matrice de transition CKDA.
QUESTION — Comment détecter efficacement et à moindre coût les échecs d'alignement dans les modèles de langage déployés sans recourir à des juges génératifs coûteux?
Une seule question générique atteint un AUROC médian de 0,886 en zero-shot et bat les bases de référence supervisées sur la plupart des benchmarks.