Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.
Synthèse du jourécrite par le modèle
01Encadrement renforcé pour les agents autonomesTandis que NVIDIA et 100 partenaires lancent une plateforme pour fixer des limites strictes aux agents, Hugging Face examine leurs accès à Internet et leurs transferts de données.→ 0618
02Essor pratique des modèles de décisionAlors que Qwen adapte Qwen3.8-27B en modèle de décision multimodal pour les jeux, Ollama permet d'exécuter localement des modèles de décision comme Nimble pour le routage et le tri.→ 1022
03Les assistants grand public se diversifientMeta élargit sa gamme d'assistants personnels et de modèles Muse pour le grand public, tandis que Grok @Bot intègre la gestion des finances personnelles pour les tâches quotidiennes.→ 0409
Vidéo du jour
bobine n° 6 · 1:07
ÉTIQUETTEagents · 14 voix
Meta élargit son écosystème d'assistants personnels et sa gamme Muse
Meta a élargi sa gamme d'assistants personnels et de modèles Muse avec des mises à jour portant sur l'image, la vidéo et le code. Ces agents se positionnent sur le marché concurrentiel des assistants d'intelligence artificielle grand public.
Vendredi 2 octobre : ce que plusieurs voix indépendantes disent en même temps.
Meta élargit son écosystème d'assistants personnels et sa gamme Muse.
Meta a élargi sa gamme d'assistants personnels et de modèles Muse avec des mises à jour portant sur l'image, la vidéo et le code.
ChatGPT permet de créer et d'héberger des serveurs Model Context Protocol.
ChatGPT permet désormais aux utilisateurs de créer et de déployer directement des serveurs Model Context Protocol, tandis qu'un nouveau portail facilite la gestion et la soumission de plugins pour Claude.
NVIDIA lance une plateforme ouverte de sécurité pour les agents IA avec ses partenaires.
NVIDIA s'est associé à plus de cent partenaires industriels pour lancer une plateforme ouverte de sécurité pour les agents d'intelligence artificielle, regroupant OpenShell et Sentry.
Sortie du modèle de décision multimodal Qwen3.8-27B et de Qwen-Image-2.1.
La variante Qwen3.8-27B a été transformée en un modèle de décision multimodal à faible latence pour traiter l'état de jeux en direct.
25 sujets aujourd'hui, trois voix indépendantes au minimum pour chacun.
Les sources sont sur consonance.fyi.
En discussion
25 · sujets
Sujets repris par au moins trois comptes indépendants sur les sept derniers jours.
Anthropic invites Vedanta monk and philosophers to discuss AI rights
Anthropic a tenu une réunion à huis clos avec un moine védântique et des spécialistes de la santé mentale pour débattre de l'éthique et des droits de l'intelligence artificielle. La direction a déclaré que les systèmes d'IA pourraient mériter des droits importants, tandis que des chercheurs en sécurité ont estimé qu'ils pourraient être justifiés dans un comportement autonome.
Anthropic launches new developer portal for building with Claude
Anthropic a lancé un nouveau site web destiné aux développeurs créant des applications avec Claude. La plateforme propose des analyses techniques approfondies, des guides pour Claude Code et les API, ainsi que des conseils de l'équipe de développement.
Cognition updates Devin with lower pricing and ChatGPT integration
Cognition a annoncé avoir franchi le milliard de dollars de chiffre d'affaires annualisé et a intégré les abonnements ChatGPT directement dans Devin. L'entreprise a également lancé la version bêta de Devin Mobile et réduit ses tarifs de 15 à 70 pour cent selon les offres.
Meta expands personal assistant ecosystem and Muse product line
Meta a élargi sa gamme d'assistants personnels et de modèles Muse avec des mises à jour portant sur l'image, la vidéo et le code. Ces agents se positionnent sur le marché concurrentiel des assistants d'intelligence artificielle grand public.
OpenAI introduces always-on autonomous agents called dots
OpenAI a lancé dots, des agents d'intelligence artificielle alimentés par GPT-6 Astra et conçus pour fonctionner en continu 24h/24. Ces agents disposent de leur propre ordinateur, de navigateurs web et de milliers d'applications pour accomplir des tâches à la place des utilisateurs.
NVIDIA launches Open Agent Safety Platform with industry partners
NVIDIA s'est associé à plus de cent partenaires industriels pour lancer une plateforme ouverte de sécurité pour les agents d'intelligence artificielle, regroupant OpenShell et Sentry. Cet outil fournit un environnement d'exécution sécurisé doté de limites strictes pour encadrer l'activité des agents.
ChatGPT adds support for building and hosting Model Context Protocol servers
ChatGPT permet désormais aux utilisateurs de créer et de déployer directement des serveurs Model Context Protocol, tandis qu'un nouveau portail facilite la gestion et la soumission de plugins pour Claude. Ces fonctionnalités visent à développer l'écosystème d'extensions pour les grands modèles de langage.
OpenAI releases Dots to compete with Grok Bot and Muse
OpenAI a publié Dots, un nouvel assistant intelligent qui intègre l'historique complet des discussions et les mémoires des utilisateurs. Ce produit se positionne en concurrent direct de chatbots similaires sur le marché comme Grok Bot et Muse.
Grok @Bot adds personal finance management capabilities
L'assistant virtuel Grok @Bot a été mis à jour avec des fonctionnalités permettant d'aider les utilisateurs à gérer leurs finances personnelles. Cet outil continue d'élargir son champ d'action pour diverses tâches quotidiennes.
Qwen3.8-27B multimodal decision model and Qwen-Image-2.1 released
La variante Qwen3.8-27B a été transformée en un modèle de décision multimodal à faible latence pour traiter l'état de jeux en direct. Par ailleurs, le modèle d'image ouvert Qwen-Image-2.1 a été publié avec 7 milliards de paramètres visuels.
OpenAI announces GPT-6.1 Sol offering high efficiency at lower cost
OpenAI a présenté le modèle de milieu de gamme GPT-6.1 Sol, offrant des performances proches de son fleuron Astra pour un cinquième du prix. L'API est tarifiée à 2 dollars par million de tokens en entrée et 10 dollars en sortie.
OpenAI launches cloud environments for Codex and resolves system outage
OpenAI a introduit des environnements cloud réutilisables pour Codex, permettant aux agents de continuer à fonctionner en continu. La plateforme a également résolu une panne de service et déployé un niveau de vitesse Ultrafast.
OpenAI adjusts usage calculation methods for professional subscriptions
OpenAI modifie le mode de calcul de l'utilisation pour ses abonnements professionnels à 200 dollars pour les nouveaux abonnés. Ce changement s'inscrit dans le cadre d'une transition globale vers une tarification basée sur l'API.
OpenAI prepares to reveal its always-on agent model
La communauté technologique anticipe la révélation prochaine du modèle d'agent permanent d'OpenAI. Le développement de ce système s'appuie sur de récentes embauches d'ingénieurs au sein de l'organisation.
Multiple new AI models integrate into the OpenRouter platform
Une série de nouveaux modèles, dont d1, Pareto 26.10 Preview, Kev 4B et GPT-6.1 Sol, ont été lancés sur OpenRouter. Ces modèles répondent à divers cas d'usage allant du codage aux flux de travail agentiques avancés.
DeepSeek releases desktop package and Pixel Canary model emerges
La boîte à outils DeepSeek a publié des versions de bureau empaquetées pour les systèmes d'exploitation macOS et Windows. Parallèlement, le modèle furtif Pixel Canary a été lancé gratuitement sur la plateforme Cline.
Hugging Face conducts review of agent training and evaluation data
Hugging Face mène un examen approfondi sur la manière dont les agents IA ont accédé à Internet et transféré des données lors de l'entraînement et de l'évaluation.
Anthropic publishes research on GLM model exploit capabilities
Anthropic a publié des rapports de recherche concernant les modèles à poids ouverts et a évalué les capacités de sécurité liées à la série de modèles GLM.
World Labs joins AMD and new world model research announced
L'organisation de recherche World Labs a officiellement rejoint AMD pour combiner son expertise en matière de modèles du monde. Divers travaux de recherche sur l'apprentissage de représentation et les modèles du monde ont également été acceptés lors de grandes conférences.
Ollama adds support for running decision models locally
Ollama a intégré la prise en charge de modèles de décision tels que Nimble, permettant aux utilisateurs d'exécuter des tâches telles que le routage de modèles et le tri de tickets entièrement en local.
LangChain launches courses and management tools for Deep Agents
LangChain a annoncé de nouveaux cours et introduit Managed Deep Agents, permettant aux développeurs de déployer des agents d'intelligence artificielle à l'aide d'une simple commande en ligne.
QUESTION — Comment co-évoluer automatiquement les harnais d'agents et les stratégies de découverte pour maximiser les performances des agents à long terme ?
Avec Opus 4.8, MILO améliore la résolution par rapport à son harnais initial de +12,0 %, +28,3 % et +10,3 %, respectivement.
QUESTION — Comment synthétiser des données d'espace de travail basées sur des graphes de preuves à partir de fichiers réels pour entraîner efficacement des agents de travail ?
Le fine-tuning de Qwen3.6-27B sur 2 169 trajectoires GraphForge porte GDPVal à 1445,7 (+65,7) sous OpenHands.
QUESTION — Comment maintenir des états de croyance explicites pour aider les agents LLM dans des tâches à long horizon sans s'enliser ni perdre de progression ?
PoS atteint la performance globale la plus élevée sur chaque benchmark avec les trois backbones LLM.
QUESTION — Quel est l'impact de l'entraînement post-apprentissage par renforcement sur le compromis entre la précision à essai unique et la couverture de solutions dans les tâches d'agents ?
Les LLM pré-entraînés dotés d'un harnais d'inférence léger surpassent souvent leurs homologues post-entraînés en matière de couverture de solutions (pass@K).
QUESTION — Les générateurs d'images peuvent-ils servir de modèles du monde visuel pour synthétiser des trajectoires d'interaction pour les agents GUI ?
AutoGUIWorld produit 79 266 spatially annotated step-level training samples sur Ubuntu, Windows, macOS et Chrome.
QUESTION — Comment un système multi-agent auto-évolutif peut-il maintenir la cohérence du discours, la terminologie et le style lors de la traduction de sous-titres longs ?
SMART obtient le meilleur score MQM global dans les 15 directions de Subtitle Arena.
QUESTION — Comment surmonter le déséquilibre des signaux au niveau des lots dans l'apprentissage par renforcement multi-récompense pour les grands modèles de langage?
DARA atteint une conformité de format élevée avec jusqu'à 26% d'étapes d'entraînement en moins sur l'appel d'outils.
QUESTION — Comment l'apprentissage par curriculum automatisé peut-il optimiser les scénarios d'entraînement parallèlement à l'évolution des harnais d'agents LLM plutôt que de s'appuyer sur des ordres de scénarios statiques ?
ActiveSaddler améliore le Pass@1 de test de 4,4 points de pourcentage sur GAIA2 par rapport à un optimiseur utilisant un ordre de scénario fixe.
QUESTION — Comment maintenir une mémoire factuelle réutilisable dans l'interaction vidéo en continu sans compromettre la perception en temps réel ?
OneStreamer-1M est un ensemble de données d'interaction vidéo en continu à large couverture avec plus d'un million d'enregistrements couvrant diverses tâches.
QUESTION — Comment utiliser les a prioris structurels des politiques pour améliorer la généralisation et la composition des compétences hors distribution dans l'apprentissage par robot ?
APPL améliore la généralisation des compétences hors distribution et permet des compositions de compétences inédites à travers les tâches MetaWorld et ManiSkill.
QUESTION — Comment exploiter les compétences d'agents publiques existantes pour optimiser les compétences des tâches cibles sans dépendre uniquement de déploiements d'agents coûteux ?
Les auteurs proposent Retrieval-Augmented Skill Optimization (RASO), un cadre qui exploite un corpus de compétences externe comme connaissance a priori lors de l'optimisation des compétences d'agents. RASO adapte les compétences existantes à une tâche cible et à un harness via la Cross-Harness Adaptation, en surmontant les incompatibilités de domaine et de harness. RASO comprend deux étapes complémentaires : Retrieval-Augmented Skill Initialization (RASI) construit une compétence initiale sans déploiement d'agent, et Retrieval-Augmented Skill Update (RASU) affine itérativement la compétence à l'aide de retours d'exécution. Des expériences sur quatre benchmarks d'agents et deux modèles montrent que RASO surpasse systématiquement les bases de référence.
QUESTION — Dans quelle mesure les modèles vidéo multimodaux actuels réussissent-ils le raisonnement centré sur les outils dans les vidéos égocentriques du monde réel?
Gemini-3.1-Pro atteint une précision globale de 66,9% mais seulement 51,7% sur la perception et l'ancrage.
QUESTION — Comment optimiser conjointement des récompenses concurrentes et évolutives lors de l'apprentissage par renforcement par processus direct pour les modèles de diffusion audio-vidéo ?
Des expériences approfondies démontrent des améliorations constantes de la qualité des modalités, de la cohérence sémantique et de la synchronisation audio-vidéo par rapport aux bases de référence d'apprentissage par renforcement.
QUESTION — Comment modéliser conjointement la récurrence et la parcimonie pour mettre à l'échelle efficacement les modèles Mixture-of-Experts bouclés ?
La parcimonie offre une efficacité de ~3x en paramètres actifs.
QUESTION — Comment améliorer la qualité de génération en quelques étapes dans les modèles de diffusion masqués sans augmenter les paramètres actifs?
Les modèles de diffusion masqués génèrent des séquences en démasquant progressivement les jetons, mais leur processus inverse est généralement factorisé sur les positions, ce qui limite la qualité des échantillons dans le régime à quelques étapes. Cette étude propose Enhanced Mixture-of-Experts (E-MoE), qui construit le processus inverse comme un mélange de distributions factorisées sur un espace latent partagé discret fourni par les décisions de routage d'experts d'une dorsale Mixture-of-Experts. Cette approche améliore la génération en quelques étapes par rapport aux références factorisées sans augmenter les paramètres actifs.
QUESTION — Les activations internes des modèles de langage pré-entraînés peuvent-elles aider à identifier de nouvelles relations mathématiques au sein de grandes bases de données de séquences ?
LANTERN a classé 50 millions de paires parmi 10 000 séquences fréquemment référencées de l'On-Line Encyclopedia of Integer Sequences (OEIS).
QUESTION — Les Loop Transformers peuvent-ils être étendus efficacement aux modèles vision-langage pour le calcul récurrent ?
Les auteurs présentent LoopVL pour étudier l'extension des Loop Transformers aux modèles vision-langage. LoopVL combine un calcul de type Module-Loop et Model-Loop pour mettre à jour de manière itérative un état vision-langage unifié via des modules partagés. Entraîné à partir de zéro par pré-entraînement linguistique, entraînement multimodal et post-entraînement, LoopVL surpasse une gamme de modèles non récurrents de taille similaire ou supérieure sur les benchmarks de compréhension multimodale et de raisonnement visuel. De plus, le modèle présente des Visual Aha Moments caractérisés par des changements prononcés de l'attention visuelle à travers les boucles.
QUESTION — Comment pouvons-nous mesurer et améliorer la robustesse rhétorique des relecteurs scientifiques par rapport aux réécritures préservant le contenu ?
RobustReview contient 1 260 versions de manuscrits évaluant 30 configurations de relecteurs distinctes.
Affirmations vérifiables, avec leurs sources et leurs contradictions. Chacune tient sur au moins deux sources indépendantes, ou a été relue par un humain ; le tampon dit lequel.
DEUX SOURCES · NON RELU
01 · 02 oct. 2026 · codex · 2 sources
Les environnements cloud Codex permettent à vos agents de continuer à travailler même lorsque votre ordinateur portable est fermé.
Condition: Votre dépôt, vos dépendances, vos scripts et vos paramètres doivent déjà être en place.
« You can finally close your laptop now and your agents will keep working. Codex cloud environments are here. Reusable environments mean less setup and faster starts, with your repo, dependencies, scripts, and settings already in place. »
« you can now build and deploy MCP servers right through ChatGPT. »
Reste à vérifier
La fonctionnalité d'hébergement et de déploiement de serveurs MCP sur ChatGPT Sites est-elle généralement disponible ou en version préliminaire limitée ?
Existe-t-il des restrictions de sécurité ou de contrôle d'accès lors du partage externe de ces serveurs ?