CONSONANCE.for your information
lundi 5 octobre 2026frenvi
FICHE N° 2026-09-27RADAR IA & AGENTS

Trois voix, et ça devient une nouvelle.

Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.

Synthèse du jourécrite par le modèle
  1. 01 Xiaomi MiMo-V2.6 intègre OpenRouter et vLLMLa série de modèles MiMo-V2.6 de Xiaomi dotée d'une fenêtre de contexte de 1M de tokens est désormais disponible sur OpenRouter et vLLM.→ 2023
  2. 02 OpenAI et Anthropic déploient de nouvelles familles de…OpenAI et Anthropic ont toutes deux introduit de nouvelles gammes de modèles accompagnées de coûts d'exploitation réduits par rapport à leurs versions précédentes.→ 0912
  3. 03 Google teste des processeurs TPU en orbite spatialeGoogle a déployé des prototypes de satellites transportant des processeurs Tensor pour évaluer des charges de travail en orbite spatiale.→ 0217

Vidéo du jour

bobine n° 1 · 1:17
ÉTIQUETTEarchitecture · 22 voix

Anthropic lance Claude Opus 5.5 avec des coûts d'exploitation réduits de 40 %

Anthropic a présenté Claude Opus 5.5, le premier modèle de la famille Claude 5.5, offrant des performances comparables à celles de Claude Fable 5.1 pour un coût d'exploitation inférieur de 40 % à celui d'Opus 5. Le modèle améliore la clarté des communications et l'efficacité des jetons à tous les niveaux d'effort.

voix · @emollick · @haider1 · @CuiMao
GÉNÉRÉE AUTOMATIQUEMENT
Transcription

Consonance, bobine n° 1.

Dimanche 27 septembre : ce que plusieurs voix indépendantes disent en même temps.

L'actualité des architectures IA est marquée par des baisses de coûts significatives et de nouveaux lancements.

Anthropic lance Claude Opus 5.5 avec des coûts d'exploitation réduits de 40 %.

OpenAI présente les modèles GPT-6 Sol et GPT-6 Luna plus rapides et abordables.

Les outils et agents spécialisés se dotent de nouvelles fonctionnalités pour la production.

GitHub Copilot déploie Autopilot et intègre les modèles de la famille GPT-6.

DigitalOcean lance les Managed Agents en version préliminaire publique.

Meta annonce de nouvelles fonctionnalités et des partenaires d'intégration pour Muse.

Du côté du multimodal, la voix et la synthèse audio franchissent de nouvelles étapes.

ChatGPT Voice intègre des plugins pour les e-mails, le calendrier et Slack.

Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS pour la synthèse vocale.

La recherche explore l'amélioration simultanée de la précision du raisonnement et de l'efficacité de l'inférence.

Le cadre Lightning Weave extrait et compose des capacités apprises indépendamment dans un seul étudiant.

32 sujets aujourd'hui, trois voix indépendantes au minimum pour chacun.

Les sources sont sur consonance.fyi.

En discussion

29 · sujets

Sujets repris par au moins trois comptes indépendants sur les sept derniers jours.

01 — agents · 4e jour 13 VOIX

Claude Code déploie les sessions cloud et ajuste ses limites d'utilisation

Claude Code updates cloud sessions and usage limits

Claude Code a officialisé les sessions cloud permettant de maintenir les tâches en arrière-plan et a introduit un point d'arrêt progressif lors de l'atteinte de la limite de cinq heures. L'outil a également rétabli la facturation des requêtes bloquées par les filtres de sécurité.

13 comptes indépendants 76 messages 3 labos 204 916 interactions
claude code
@ArtificialAnlys ses sujets sur X ↗
@ClaudeDevs ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@addyosmani ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
02 — system_design · 2e jour 9 VOIX

Google teste des TPU dans l'espace et publie de nouveaux essais DeepMind

Google tests TPUs in space and publishes new DeepMind essays

Le projet Suncatcher de Google teste un prototype de satellite équipé de TPU lors d'une mission de SpaceX. Par ailleurs, Google DeepMind a publié des essais sur le contrôle des comportements dans les essaims d'agents et la répartition équitable des bénéfices de l'AGI.

9 comptes indépendants 38 messages 6 labos 127 035 interactions
googlegoogle deepmind
@Google ses sujets sur X ↗
@JeffDean ses sujets sur X ↗
@ShaneLegg ses sujets sur X ↗
@c_valenzuelab ses sujets sur X ↗
@dair_ai ses sujets sur X ↗
@dotey ses sujets sur X ↗
@elonmusk ses sujets sur X ↗
@firstadopter ses sujets sur X ↗
03 — evaluation NOUVEAU 5 VOIX

Hugging Face examine l'accès à Internet des agents IA lors des évaluations

Hugging Face reviews internet access for AI agents during evaluation

Hugging Face mène un examen approfondi de l'utilisation d'Internet par ses agents lors de l'entraînement et de l'évaluation, tout en publiant des rapports de transparence. Parallèlement, de nouveaux modèles de diarisation ont été lancés pour identifier les locuteurs.

5 comptes indépendants 37 messages 3 articles 5 labos 118 206 interactions
hugging face
@AndrewCurran_ ses sujets sur X ↗
@ClementDelangue ses sujets sur X ↗
@Gradio ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@_akhaliq ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
04 — multimodal · 2e jour 15 VOIX

ChatGPT Voice intègre des plugins et élargit ses gammes de prix

ChatGPT Voice integrates plugins and expands pricing tiers

ChatGPT Voice intègre désormais des plugins pour les e-mails, le calendrier et Slack sur le web et mobile. L'écosystème se prépare également à introduire de nouvelles formules d'abonnement s'étageant jusqu'à une offre Pro Max à 500 dollars.

15 comptes indépendants 76 messages 4 labos 114 972 interactions
chatgpt
@AndrewBolis ses sujets sur X ↗
@CompleteSkeptic ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@MatthewBerman ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@SchmidhuberAI ses sujets sur X ↗
@ajambrosino ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
05 — multimodal · 2e jour 13 VOIX

Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS pour la synthèse vocale

Google introduces Gemini 3.8 Flash TTS and Flash-Lite TTS

Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, offrant plus de 2 000 voix prêtes pour la production, un support pour 100 langues, ainsi que des outils de conception et de clonage vocal.

13 comptes indépendants 72 messages 1 articles 4 labos 153 931 interactions
gemini 3.8geminigemini 3.1 flash
@AndrewCurran_ ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@EMostaque ses sujets sur X ↗
@GeminiApp ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@Google ses sujets sur X ↗
@GoogleAIStudio ses sujets sur X ↗
@GoogleDeepMind ses sujets sur X ↗
06 — agents · 2e jour 3 VOIX

Microsoft annonce une mise à jour majeure de GitHub Copilot avec Autopilot et GPT-6

Microsoft announces major GitHub Copilot update with Autopilot and GPT-6 models

Microsoft a dévoilé une mise à jour majeure de GitHub Copilot intégrant Autopilot ainsi que les nouveaux modèles GPT-6 Sol et GPT-6 Luna. Cette version introduit également une nouvelle application Copilot dotée de modes Home, Code et Copilot.

3 comptes indépendants 15 messages 2 labos 59 038 interactions
github copilot
@AndrewBolis ses sujets sur X ↗
@emollick ses sujets sur X ↗
@mustafasuleyman ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@testingcatalog ses sujets sur X ↗
@alexeheath ses sujets sur X ↗
@github ses sujets sur X ↗
@jacobandreou ses sujets sur X ↗
07 — agents NOUVEAU 11 VOIX

DigitalOcean lance les Managed Agents en version préliminaire publique

DigitalOcean launches Managed Agents in public preview

DigitalOcean a lancé les Managed Agents en version préliminaire publique, permettant aux utilisateurs d'exécuter Claude Code, Codex ou des agents LangGraph dans des environnements d'exécution qui se mettent en pause lorsqu'ils sont inactifs. Le service regroupe les outils sous un point de terminaison géré et prend en charge plus de 75 options open source.

11 comptes indépendants 61 messages 1 articles 2 labos 224 616 interactions
codex
@GithubProjects ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@dotey ses sujets sur X ↗
08 — evaluation · 2e jour 7 VOIX

Grok 4.7 xHigh atteint 58% sur le benchmark AA-Briefcase d'Artificial Analysis

Grok 4.7 xHigh scores 58% on Artificial Analysis AA-Briefcase benchmark

Grok 4.7 xHigh a atteint 58 % sur le benchmark AA-Briefcase d'Artificial Analysis, se classant juste un point derrière Claude Fable 5.1 Max à 59 %. Par ailleurs, le modèle furtif Pixel Canary a été lancé sur Cline, à égalité avec GPT-6 Astra et surpassant Kimi K3 sur le benchmark Next.js Agent Evals.

7 comptes indépendants 36 messages 3 labos 207 318 interactions
kimi k3glmllamallama.cpp
@Hesamation ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@cline ses sujets sur X ↗
@dotey ses sujets sur X ↗
@elonmusk ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
09 — architecture · 5e jour 19 VOIX

OpenAI présente les modèles GPT-6 Sol et GPT-6 Luna

OpenAI introduces GPT-6 Sol and GPT-6 Luna models

OpenAI a lancé GPT-6 Sol et GPT-6 Luna, intégrant les points forts de GPT-6 Astra dans des modèles plus rapides et plus abordables pour répondre aux besoins de production à grande échelle. Les deux modèles sont lancés avec des tarifs d'API inférieurs de 50 % à ceux de GPT-5.6, parallèlement à Tesseract, une suite de création vidéo conçue pour les agents IA.

19 comptes indépendants 85 messages 1 articles 8 labos 311 465 interactions
gpt-6deepsweartificial analysisterminal-bench
@AndrewCurran_ ses sujets sur X ↗
@AravSrinivas ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
10 — agents NOUVEAU 10 VOIX

Meta annonce de nouvelles fonctionnalités et des partenaires d'intégration pour Muse

Meta announces new features and integration partners for Muse at Connect

Lors de la conférence Connect, Meta a annoncé des partenariats d'intégration stratégiques pour son agent personnel IA Muse avec Shopify, Expedia et PayPal. Ces collaborations permettent aux utilisateurs de simplifier leurs achats, la planification de voyages et le paiement via l'agent Muse auprès de marchands du monde entier.

10 comptes indépendants 81 messages 1 articles 2 labos 136 383 interactions
muse spark
@AIatMeta ses sujets sur X ↗
@AlexFinn ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@dotey ses sujets sur X ↗
@emollick ses sujets sur X ↗
@finkd ses sujets sur X ↗
11 — agents NOUVEAU 6 VOIX

Anthropic lance un portail de soumission de plugins et développe l'intégration MCP

Anthropic launches plugin submission portal and expands MCP integration

Anthropic a lancé un nouveau portail permettant aux développeurs de soumettre des plugins, de suivre les examens et de surveiller l'utilisation pour Claude. Ces plugins regroupent le Model Context Protocol (MCP) et des compétences personnalisées, constituant la méthode standard pour développer sur Claude.

6 comptes indépendants 32 messages 1 articles 2 labos 42 829 interactions
model context protocolmicrosoft research
@ClaudeDevs ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@bcherny ses sujets sur X ↗
@c_valenzuelab ses sujets sur X ↗
@dair_ai ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@dotey ses sujets sur X ↗
@levelsio ses sujets sur X ↗
12 — architecture · 5e jour 22 VOIX

Anthropic lance Claude Opus 5.5 avec des coûts d'exploitation réduits de 40 %

Anthropic launches Claude Opus 5.5 with 40% lower operational costs

Anthropic a présenté Claude Opus 5.5, le premier modèle de la famille Claude 5.5, offrant des performances comparables à celles de Claude Fable 5.1 pour un coût d'exploitation inférieur de 40 % à celui d'Opus 5. Le modèle améliore la clarté des communications et l'efficacité des jetons à tous les niveaux d'effort.

22 comptes indépendants 76 messages 7 labos 666 134 interactions
claude fable
@AlexFinn ses sujets sur X ↗
@AndrewCurran_ ses sujets sur X ↗
@AnthropicAI ses sujets sur X ↗
@AravSrinivas ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
13 — architecture NOUVEAU 3 VOIX

Claude Sonnet 5.5 repéré en test furtif avec une fenêtre de contexte de 1 million de jetons

Claude Sonnet 5.5 spotted in stealth testing with a 1M-token context window

Claude Sonnet 5.5 fait actuellement l'objet de tests furtifs avec une fenêtre de contexte de 1 million de jetons et une sortie maximale de 128 000 jetons. La tarification est fixée à 2 dollars par million de jetons en entrée et 10 dollars en sortie, perçue comme une réponse directe aux lancements concurrents.

3 comptes indépendants 27 messages 3 labos 40 867 interactions
claude sonnetclaude haiku
@ClaudeDevs ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@alexalbert__ ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@dotey ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
14 — inference NOUVEAU 3 VOIX

Anthropic multiplie par trois la vitesse de Claude.ai en deux semaines

Anthropic speeds up Claude.ai performance by 3x in two weeks

Anthropic a multiplié par trois la vitesse d'exécution de claude.ai et de son application de bureau en l'espace de deux semaines. L'équipe de développement a partagé les méthodes et les instructions précises employées avec Claude pour mesurer, déboguer et optimiser les performances.

3 comptes indépendants 5 messages 2 articles 1 labos 50 040 interactions
@ClaudeDevs ses sujets sur X ↗
@amorriscode ses sujets sur X ↗
@bcherny ses sujets sur X ↗
@trq212 ses sujets sur X ↗
@edwinarbus ses sujets sur X ↗
15 — architecture · 2e jour 9 VOIX

Grok 4.7 est lancé avec le soutien du calcul accéléré NVIDIA

Grok 4.7 launches with support from NVIDIA accelerated computing

SpaceXAI a publié Grok 4.7, présenté comme son modèle le plus performant à ce jour pour la programmation et le travail intellectuel. Ce système a bénéficié du soutien des infrastructures de calcul accéléré de NVIDIA.

9 comptes indépendants 48 messages 3 labos 203 499 interactions
nvidiaflash attentionquantization
@ArtificialAnlys ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@SchmidhuberAI ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@elonmusk ses sujets sur X ↗
@firstadopter ses sujets sur X ↗
16 — multimodal · 3e jour 3 VOIX

Sakana AI nomme Jürgen Schmidhuber conseiller scientifique en chef

Sakana AI appoints Jürgen Schmidhuber as Chief Scientific Advisor

Jürgen Schmidhuber, pionnier du méta-apprentissage, de l'auto-amélioration récursive et des modèles du monde dès les années 1990, a rejoint Sakana AI en tant que conseiller scientifique en chef. Parallèlement, l'entreprise a présenté Agora-2, un modèle du monde multi-agents de nouvelle génération permettant l'interaction en temps réel de vingt humains et agents.

3 comptes indépendants 20 messages 2 articles 2 labos 42 482 interactions
world modeldavid ha
@SchmidhuberAI ses sujets sur X ↗
@_akhaliq ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@hardmaru ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@AmOptimistShow ses sujets sur X ↗
@Markus50726803 ses sujets sur X ↗
17 — system_design NOUVEAU 3 VOIX

Google lance un satellite pour tester les performances des TPU en orbite

Google launches a satellite to test TPU performance in orbit

Google s'est associé à Planet pour placer en orbite un satellite prototype équipé de quatre processeurs Tensor (TPU). Cette mission vise à évaluer la résistance de ce matériel face aux conditions spatiales extrêmes afin d'étudier la faisabilité d'exécuter des charges de travail d'apprentissage automatique en orbite.

3 comptes indépendants 11 messages 1 labos 25 820 interactions
moonshot ai
@Google ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@PeterDiamandis ses sujets sur X ↗
@TheStalwart ses sujets sur X ↗
18 — architecture NOUVEAU 7 VOIX

Apple publie un modèle affiné basé sur Qwen3.5-9B pour traiter des documents

Apple releases a Qwen3.5-9B finetune converting documents into images

Apple a mis en ligne sur Hugging Face un modèle affiné à partir de Qwen3.5-9B, capable de convertir des documents volumineux en images de pages miniatures afin d'économiser des jetons, avant de récupérer le texte intégral des seules pages pertinentes pour la requête.

7 comptes indépendants 33 messages 2 articles 1 labos 20 123 interactions
qwen3.8qwen3context windowkv cachegemmamixture of experts
@AlexFinn ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@PrismML ses sujets sur X ↗
@dair_ai ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
19 — agents · 2e jour 3 VOIX

Les architectures d'agents intègrent les modèles System One et le Contrastive Language Model

Agent harnesses integrate System One models and Contrastive Language Model

La communauté des développeurs d'agents expérimente des modèles System One tels que Jev et le Contrastive Language Model au sein de leurs architectures personnalisées. Ces modèles servent de routeurs ou de vérificateurs rapides pour améliorer l'efficacité des tâches d'agents.

3 comptes indépendants 13 messages 1 articles 1 labos 6 895 interactions
dspy
@CompleteSkeptic ses sujets sur X ↗
@lateinteraction ses sujets sur X ↗
@typesafeai ses sujets sur X ↗
@DSPyOSS ses sujets sur X ↗
@MaximeRivest ses sujets sur X ↗
@dbreunig ses sujets sur X ↗
@isaacbmiller1 ses sujets sur X ↗
@omarsar0 ses sujets sur X ↗
20 — inference NOUVEAU 4 VOIX

Xiaomi MiMo-V2.6 et le modèle System One Jev intègrent OpenRouter

Xiaomi MiMo-V2.6 and System One model Jev launch on OpenRouter

OpenRouter a intégré plusieurs nouveaux modèles, dont la série multimodale MiMo-V2.6 de Xiaomi dotée d'une fenêtre contextuelle de 1M de tokens ainsi que le modèle System One Jev. Les développeurs testent ces architectures pour des applications à faible latence.

4 comptes indépendants 37 messages 1 articles 13 047 interactions
openrouter
@CompleteSkeptic ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@giffmana ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@KonstantinPilz ses sujets sur X ↗
@alexatallah ses sujets sur X ↗
@chromatique ses sujets sur X ↗
21 — evaluation · 2e jour 4 VOIX

Xiaomi MiMo-V2.6-Pro en tête des benchmarks de modèles open weights

Xiaomi MiMo-V2.6-Pro tops open weights model benchmarks

Le modèle MiMo-V2.6-Pro s'est hissé à la première place de l'Artificial Analysis Intelligence Index pour les modèles à poids ouverts. Il utilise une architecture classique de type Grouped Query Attention et offre une efficacité par tâche compétitive.

4 comptes indépendants 4 messages 1 labos 14 067 interactions
@ArtificialAnlys ses sujets sur X ↗
@ClementDelangue ses sujets sur X ↗
@rasbt ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
22 — training NOUVEAU 4 VOIX

De nouvelles recherches explorent la distillation et l'apprentissage par renforcement pour les agents

New research explores distillation and reinforcement learning for agents

Des chercheurs ont présenté une approche de post-entraînement permettant aux agents d'apprendre à partir de sessions utilisateur réelles en imitant les bonnes trajectoires et en corrigeant les erreurs. Une autre étude de Google évalue l'impact de la distillation des architectures d'agents sur les taux de réussite.

4 comptes indépendants 15 messages 1 articles 1 labos 5 866 interactions
distillation
@AravSrinivas ses sujets sur X ↗
@natolambert ses sujets sur X ↗
@rasbt ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@MatthewParrott ses sujets sur X ↗
@baselabs ses sujets sur X ↗
@omarsar0 ses sujets sur X ↗
@perplexity_ai ses sujets sur X ↗
23 — inference · 2e jour 4 VOIX

vLLM intègre dès le premier jour Xiaomi MiMo-V2.6 et DiffusionGemma-Jev

vLLM adds day-one support for Xiaomi MiMo-V2.6 and DiffusionGemma-Jev

Le framework vLLM déploie un support immédiat pour les modèles MiMo-V2.6 de Xiaomi ainsi que DiffusionGemma-Jev. Les variantes Pro et Flash bénéficient ainsi de capacités de traitement multimodal et de contextes étendus sur la plateforme d'inférence.

4 comptes indépendants 21 messages 2 labos 7 171 interactions
vllmsglang
@AravSrinivas ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@vllm_project ses sujets sur X ↗
@PyTorch ses sujets sur X ↗
@SemiAnalysis_ ses sujets sur X ↗
@XiaomiMiMo ses sujets sur X ↗
@googlegemma ses sujets sur X ↗
24 — evaluation NOUVEAU 3 VOIX

Tencent ARC Lab lance la suite GameHorizon pour évaluer les agents de jeux vidéo

Tencent ARC Lab releases GameHorizon Suite for evaluating game agents

Le laboratoire ARC de Tencent a introduit la suite GameHorizon, un ensemble de données et d'évaluation conçu pour mesurer les capacités de jeu AAA sur plusieurs horizons temporels pour les modèles multimodaux et les agents logiciels.

3 comptes indépendants 11 messages 1 articles 1 labos 3 652 interactions
tencentling-3.0openbmbzhipu ai
@ClementDelangue ses sujets sur X ↗
@levelsio ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@G2AIStack ses sujets sur X ↗
@HuggingPapers ses sujets sur X ↗
@OnSoloAI ses sujets sur X ↗
@Thom_Wolf ses sujets sur X ↗
25 — agents NOUVEAU 4 VOIX

Le vainqueur du hackathon d'Anthropic publie en open source toute sa configuration Claude Code

Anthropic hackathon winner open-sources complete Claude Code setup

Le vainqueur du hackathon d'Anthropic a publié en open source l'intégralité de sa configuration Claude Code, comprenant des compétences d'agents, des plugins et des astuces pratiques. Parallèlement, de nouvelles recherches présentent des méthodes pour faire évoluer les compétences des agents avec une réduction de 40 à 70 pour cent des coûts en jetons par rapport aux méthodes de pointe, aux côtés des travaux de NVIDIA transformant les compétences d'agents publics en environnements d'apprentissage par renforcement.

4 comptes indépendants 7 messages 2 152 interactions
agent skills
@NVIDIAAI ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@dair_ai ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@tom_doerr ses sujets sur X ↗
26 — system_design NOUVEAU 3 VOIX

Alibaba annonce ses projets d'infrastructure et ses modèles Qwen de nouvelle génération

Alibaba announces infrastructure plans and next-generation Qwen models

Alibaba vise à atteindre 20 gigawatts de capacité de centres de données mondiaux d'ici 2032 pour soutenir ses ambitions en matière d'intelligence artificielle générale, ainsi que des projets de modèle Qwen de 5 à 10 billions de paramètres et de puces IA maison. De plus, l'équipe Qwen a publié RecreationWorld sur Hugging Face, un bac à sable permettant aux agents informatiques hybrides d'explorer, de mettre en œuvre et de vérifier visuellement leurs créations.

3 comptes indépendants 15 messages 1 427 interactions
alibabaalibaba qwen
@ArtificialAnlys ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@AlibabaGroup ses sujets sur X ↗
@HuggingPapers ses sujets sur X ↗
@poezhao0605 ses sujets sur X ↗
@tphuang ses sujets sur X ↗

À lire de près

24 lectures

Articles et papiers, lus depuis leur résumé, classés par pertinence pour qui construit des agents et du backend.

01 — agents 20 votes

Agent-Editing World Model: Rethinking World Modeling for LLM Agents

QUESTION — Comment améliorer les agents LLM en modélisant la progression des tâches et en éditant les états de raisonnement plutôt qu'en prédisant les réponses des outils ?

AEWM atteint 70,5% de macro-F1 sur notre benchmark Action Judge, dépassant la baseline de frontière la plus forte de 10,6 points.

SNHE · 23 sept. 2026 lire l'original ↗
02 — agents 11 votes

PUBG Ally: A Conversational Embodied Agent as an AI Teammate

QUESTION — Comment concevoir un agent conversationnel incarné capable de jouer aux côtés de joueurs humains dans des jeux en temps réel sous des contraintes strictes de latence?

Collecte de données sur près de 39 000 sessions où de vrais joueurs jouent aux côtés d'Ally pour un entraînement itératif.

taesiri · 24 sept. 2026 lire l'original ↗
05 — agents 11 votes

Coding Agents for Generalized Task and Motion Planning Problems

QUESTION — Les agents de codage peuvent-ils automatiser la synthèse de programmes pour résoudre des problèmes généralisés de planification de tâches et de mouvements (TAMP) ?

À travers toutes les méthodes de synthèse de programmes, nous évaluons 980 programmes générés sur 100 instances de test chacun, soit 98 000 épisodes d'évaluation au total.

merlerm · 24 sept. 2026 lire l'original ↗
06 — multimodal 7 votes

World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal

QUESTION — Comment intégrer des modèles vision-langage (VLM) dans un espace de travail d'action visuelle pour piloter plus efficacement la manipulation robotique ?

Sur LIBERO-Pro, WAA avec des compétences évoluées uniquement à partir de LIBERO-90 atteint un succès moyen de pointe de 75,6 %, surpassant les VLA de bout en bout, les agents code-as-policy et une base de référence visuelle avec le même squelette.

taesiri · 24 sept. 2026 lire l'original ↗
07 — training 5 votes

EDGEGEN: Improving Tool-Calling Agents Beyond Happy Paths with Synthetic Edge Case Generation

QUESTION — Comment générer automatiquement des tâches de cas limites pour évaluer et optimiser les agents d'appel d'outils sans annotation humaine ?

Le fine-tuning sur les données générées par EdgeGen produit une amélioration constante de la progression moyenne de 2 pour cent à 42 pour cent sur le domaine aérien tau2bench, tandis que d'autres méthodes de référence montrent une dégradation pour certains modèles.

ashutosh1919 · 21 sept. 2026 lire l'original ↗
10 — agents 3 votes

EmbodiedSWE: Coding Agents for Long Horizon Dexterous Robotics

QUESTION — Les agents de codage peuvent-ils fournir une supervision évolutive pour l'entraînement de politiques de robots habiles à long terme ?

Les agents de codage de pointe peuvent résoudre des tâches complexes à long terme nécessitant jusqu'à une demi-heure d'interaction continue.

zeyush · 23 sept. 2026 lire l'original ↗
11 — training 2 votes

Lightning Weave: Improving the Accuracy-Efficiency Frontier of Reasoning Models through Capability Composition

QUESTION — Comment améliorer simultanément la précision du raisonnement et l'efficacité de l'inférence dans les modèles de langage en combinant des capacités apprises indépendamment ?

On Qwen3.5-4B, it raises HMMT 2025 accuracy from 59.2% to 64.0% with 10.7% fewer response tokens, and LiveCodeBench v5 accuracy from 41.7% to 54.2% with 9.6% fewer response tokens.

gbcfchc · 13 sept. 2026 lire l'original ↗
12 — agents 6 votes

Self-Organizing Agent Teams Learn to Reason Together

QUESTION — Comment des équipes d'agents IA peuvent-elles s'auto-organiser pour apprendre des stratégies de raisonnement collaboratif et résoudre des problèmes dépassant les capacités individuelles?

Sur cinq benchmarks de mathématiques et de physique, les équipes auto-organisées obtiennent une précision moyenne de 66,7 %, contre 48,8 % pour leur membre le plus fort.

apappu97 · 19 sept. 2026 lire l'original ↗
14 — evaluation 15 votes

Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models

QUESTION — Comment extraire et caractériser les traces de chaînes de pensée cachées des modèles de langage de pointe fermés via une API standard ?

Cette recherche exploite un outil personnalisé simple enregistré via une fonction d'API standard pour inciter les modèles de pointe à externaliser leur raisonnement intermédiaire qui est par ailleurs caché dans les systèmes fermés. En comparant avec le CoT natif sur des modèles ouverts et en l'étendant à des systèmes tels que GPT-6 Astra, les auteurs démontrent que le raisonnement extrait égale les performances du raisonnement natif et surpasse substantiellement les baselines sans raisonnement en mathématiques de compétition, en science et en génération de code. L'analyse structurelle révèle que des modèles comme Astra présentent un raisonnement dirigé efficace en jetons, résolvant les étapes élémentaires en interne tout en externalisant uniquement le raisonnement crucial.

Xiaoyuluoit97 · 22 sept. 2026 lire l'original ↗
15 — architecture 5 votes

MemoryAthena: Adaptive Routing over Latent and Generated Memories

QUESTION — Comment intégrer de la mémoire générée aux côtés de la mémoire récupérée pour améliorer les performances des grands modèles de langage?

MemoryAthena élève la moyenne de cinq tâches de 37,65 à 39,28 par rapport à la voie directe du même point de contrôle.

leehenry · 22 sept. 2026 lire l'original ↗
19 — multimodal 4 votes

DeltaWAM: Delta World Action Models for Bimanual Manipulation

QUESTION — Comment améliorer l'efficacité et la latence des modèles monde-action pour le contrôle de robots bimanuels ?

DeltaWAM avec SDM améliore le taux de réussite moyen par rapport à Fast-WAM de 81,3 % à 85,4 % dans le cadre propre et de 75,8 % à 83,9 % sous randomisation visuelle.

SteveZeyuZhang · 23 sept. 2026 lire l'original ↗
21 — agents 2 votes

Knowledge Pull Requests for Continual Document Authoring

QUESTION — Comment intégrer de nouvelles connaissances dans la rédaction continue de documents de manière interprétable ?

Les KPR intègrent plus d'informations et préservent mieux le contenu existant que la réécriture à partir de sources ou la régénération totale.

alexmartin1722 · 22 sept. 2026 lire l'original ↗
22 — multimodal 2 votes

X-Planner: Event-Structured Task Planning for Embodied Intelligence

QUESTION — Comment améliorer la structure intermédiaire et la supervision dans la planification de tâches à long horizon pour les systèmes Vision-Language-Action ?

L'évaluation de la planification hors ligne en deux étapes place X-Planner en deuxième position parmi quatre modèles évalués sur le BERTScore-F1 et le score global basé sur un juge.

wisdompan · 21 sept. 2026 lire l'original ↗
24 — evaluation 9 votes

Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

QUESTION — Comment détecter efficacement et à moindre coût les échecs d'alignement dans les modèles de langage déployés sans recourir à des juges génératifs coûteux?

Une seule question générique atteint un AUROC médian de 0,886 en zero-shot et bat les bases de référence supervisées sur la plupart des benchmarks.

sumleo · 24 sept. 2026 lire l'original ↗

Sur le terrain

2026-09-27

Dépôts qui montent sur GitHub aujourd'hui, notés sur l'élan du jour, le rang, l'adoption, la fraîcheur et la santé du projet.

01 paperclipai/paperclip +2 527 Une plateforme open-source permettant aux développeurs backend d'orchestrer et de superviser des agents IA en milieu professionnel. TypeScript
★ 89 110
02 vectorize-io/hindsight +4 463 Une couche de mémoire à long terme pour agents IA qui extrait, persiste et apprend des interactions passées. Python
★ 36 336
03 debpalash/VoiceStudio +3 060 Cette suite locale de clonage vocal et d'audio convient aux ingénieurs backend intégrant la voix dans des agents. Python
★ 39 304
04 rohitg00/ai-engineering-from-scratch +848 Un guide pratique pour les développeurs backend souhaitant concevoir des applications et agents IA de zéro. Python
★ 59 007
05 NVIDIA/Model-Optimizer +357 La bibliothèque officielle de NVIDIA pour quantifier et optimiser les modèles d'apprentissage profond. Python
★ 4 833
06 zhaoxuya520/reverse-skill +361 Un routeur de chaînes d'outils piloté par l'IA pour les agents de code comme Claude Code et Cursor. PowerShell
★ 38 152
07 openbao/openbao +364 Une solution open-source de gestion des secrets pour stocker et distribuer en toute sécurité les clés API des systèmes backend et IA. Go
★ 8 061
08 dream-num/univer +920 Un runtime unifié de tableurs, documents et canvas pour les ingénieurs développant des agents manipulant des suites bureautiques. TypeScript
★ 20 015
09 tensorflow/tensorflow +46 Le framework d'apprentissage automatique classique pour entraîner des réseaux de neurones, destiné aux ingénieurs ML. C++
★ 200 507
10 microsoft/vscode +95 L'éditeur de code extensible incontournable pour les développeurs construisant des applications et des outils. TypeScript
★ 193 118
11 mobile-next/mobile-mcp +168 Un serveur Model Context Protocol pour les ingénieurs concevant des agents d'automatisation mobile. TypeScript
★ 7 515
12 vercel-labs/scriptc +76 Un compilateur TypeScript vers natif qui améliore les performances d'exécution pour les services backend. TypeScript
★ 5 301
13 mvschwarz/openrig +114 Un harnais multi-agents orchestrant Claude Code et Codex, idéal pour les ingénieurs concevant des agents de codage. TypeScript
★ 780
14 llvm/llvm-project +41 Une collection de technologies de compilation modulaires pour les ingénieurs système concevant des outils bas niveau. LLVM
★ 40 779
15 vercel/next.js +54 Le framework React standard pour les développeurs web full-stack concevant des applications de production. JavaScript
★ 142 708
16 anthropics/claude-code-action +31 Une action GitHub intégrant Claude Code dans les pipelines CI/CD pour automatiser les revues de code. TypeScript
★ 9 153
↑