Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.
Vidéo du jour
bobine n° 7 · 1:15
ÉTIQUETTEinference · 23 voix
Claude Sonnet 5.5 sort avec une vitesse accrue de 30% et une isolation des sessions
Claude Sonnet 5.5 a été lancé avec une vitesse supérieure de 30% et des coûts réduits pour les tâches courantes. Il intègre une conservation de la réflexion pour empêcher les attaques de distillation lors du changement de compte.
Google releases Gemini 4 Argon with a 1M token output limit
Google a introduit Gemini 4 Argon, offrant des performances accrues dans les flux de travail de génie logiciel et de cybersécurité. Le modèle intègre une limite de sortie d'un million de tokens tout en affichant des coûts compétitifs sur les indices d'évaluation.
Claude Code adds support for custom mods and UI modifications
Claude Code permet désormais aux utilisateurs de personnaliser l'interface, de modifier les comportements et d'intégrer des fonctionnalités via des plugins en TypeScript. La mise à jour ajoute également des outils de création d'évaluations pour optimiser les applications.
ChatGPT opens its platform allowing users to build native plugin apps
La plateforme ChatGPT s'ouvre pour permettre aux développeurs de concevoir et de déployer des applications de plugins natives directement dans les conversations, ciblant une vaste base d'utilisateurs hebdomadaires.
Codex adds premium speed tiers and cloud environments
Codex a déployé un palier de vitesse supérieure baptisé Ultrafast, augmentant le débit de génération de tokens dans l'API et les interfaces de programmation. La mise à jour introduit également des environnements cloud réutilisables.
La plateforme Devin permet désormais aux utilisateurs de se connecter avec leurs abonnements ChatGPT Plus ou Pro pour déduire directement leurs quotas d'utilisation, tout en annonçant des réductions de tarifs sur plusieurs forfaits.
ChatGPT Sites adds support for hosting and deploying MCP servers
ChatGPT Sites permet aux utilisateurs d'héberger et de déployer directement des serveurs Model Context Protocol via la plateforme. Cette fonctionnalité facilite la création et le partage d'extensions de données.
Muse faces privacy backlash over user data leaks and releases open-source hardware firmware
L'application Muse a fait l'objet de vives critiques en matière de confidentialité après avoir divulgué des données sensibles d'utilisateurs. Parallèlement, le projet a annoncé un micrologiciel ESP32 open source et un SDK Linux pour le développement de matériel compatible.
Claude Sonnet 5.5 releases with 30% faster speed and isolated context thinking
Claude Sonnet 5.5 a été lancé avec une vitesse supérieure de 30% et des coûts réduits pour les tâches courantes. Il intègre une conservation de la réflexion pour empêcher les attaques de distillation lors du changement de compte.
Performance evaluations of Claude 5.5 and Fable 5.5 reveal reduced hallucination rates
Les tests de référence indiquent qu'Opus 5.5 affiche des taux d'hallucination réduits et de bons scores aux évaluations. Parallèlement, les utilisateurs signalent le routage des requêtes vers Fable 5.5 avec des résultats améliorés.
Anthropic files for IPO, revealing 1,088% revenue growth and surging compute costs
Anthropic a déposé son dossier d'introduction en bourse, affichant un chiffre d'affaires de 4,59 milliards de dollars, soit une hausse de 1 088 % par rapport à l'exercice précédent. Le document souligne également la forte augmentation des coûts de calcul.
Anthropic launches new developer portal for engineering guides and resources
Anthropic a introduit un portail dédié aux développeurs regroupant des analyses techniques approfondies et des guides d'utilisation. Sonnet 5.5 a également été déployé pour alimenter la version gratuite de la plateforme web.
NVIDIA introduces Open Agent Safety Platform to secure AI agent execution
NVIDIA s'est associé à plus de 100 partenaires industriels pour lancer l'Open Agent Safety Platform, combinant OpenShell et Sentry. L'infrastructure fournit un environnement d'exécution sécurisé doté de limites strictes pour les agents.
OpenAI introduces Dots, autonomous 24/7 AI agents operating across applications
OpenAI a lancé Dots, une gamme d'agents autonomes conçus pour piloter des ordinateurs, des navigateurs et des milliers d'applications. Le système est capable d'exécuter des flux de travail complexes et de gérer des tâches de service.
OpenAI develops assistant competing with existing bot offerings
OpenAI lance Dots, un assistant doté d'un accès aux mémoires ChatGPT et conçu pour fonctionner en continu 24h/24 et 7j/7 en tant qu'extension de l'utilisateur.
Fireworks Research releases Ember-1 built on Kimi K3
Fireworks Research a développé Ember-1 sur la base du modèle Kimi K3. Ce modèle a bénéficié d'un entraînement postérieur pour réduire la redondance dans son raisonnement, permettant d'économiser environ 40 % de jetons tout en conservant des performances équivalentes sur les benchmarks.
OpenAI modifies usage calculation for the $200 Pro subscription
OpenAI rouvre les abonnements Pro à 200 dollars aux nouveaux utilisateurs tout en modifiant le mode de calcul de l'utilisation. Ce changement réduit de moitié les quotas équivalents à l'API pour ce niveau d'abonnement.
Qwen3.8-27B optimized for multimodal decision-making tasks
Le modèle Qwen3.8-27B a été transformé en un modèle de décision multimodal capable de prendre des décisions en moins de 100 ms à partir de l'état de jeux en direct. Ce modèle dense est désormais accessible via Nebius pour la création d'agents et les flux de travail complexes.
OpenRouter a intégré le modèle Pareto 26.10 Preview au tarif de 0,80 dollar par million de jetons en entrée et 3,20 dollars par million en sortie. Il s'agit d'un modèle composite multimodal destiné à la recherche, au code et aux flux de travail autonomes.
Llama.cpp adds local support for decision models through the /v1/systemone endpoint
Llama.cpp prend désormais en charge les modèles de décision via l'endpoint /v1/systemone. Les utilisateurs peuvent exécuter ces modèles localement sur leurs appareils de manière efficace et confidentielle.
OpenAI teases always-on agent capabilities for upcoming DevDay event
OpenAI a dévoilé l'arrivée prochaine d'agents autonomes permanents pour les utilisateurs professionnels à la veille de son événement DevDay, conçus pour fonctionner en continu.
World Labs joins the AMD ecosystem to develop world models
World Labs a rejoint l'écosystème AMD afin de combiner ses expertises en IA et en modèles du monde. Cette collaboration vise à faire progresser la recherche et le développement de modèles de fondation mondiaux pour l'IA physique.
Cohere launches the Embed 5 embedding model family
Cohere a présenté Embed 5, une nouvelle famille de modèles d'intégration comprenant la version haute performance Embed 5 Pro et la version à faible latence Embed 5 Fast. Cette sortie apporte des capacités de pointe aux applications de recherche et de traitement du langage.
LangChain releases updates for Deep Agents and MCP adapters
LangChain a publié la version 2.0 de ses adaptateurs MCP, prenant en charge la dernière version sans état du protocole pour les agents TypeScript. La plateforme a également mis à jour sa formation LangChain Academy pour introduire des agents profonds gérés afin de simplifier le déploiement.
QUESTION — Comment combiner efficacement les interfaces graphiques et les lignes de commande pour les agents d'utilisation d'ordinateurs ?
HybridCUA-9B achieves 53.6% accuracy on OSWorld, improving over the base model by 14.8 percentage points, and improves performance on WindowsAgentArena by 4.0 percentage points.
QUESTION — Comment extraire des sous-procédures réutilisables à partir de flux d'actions plats et les intégrer directement dans les poids du modèle pour améliorer la généralisation des agents multi-étapes sans appels LLM?
X-Tree améliore le taux de réussite jusqu'à 4.5% SR sur WebArena.
QUESTION — Comment faire évoluer les programmes de récompense au moment de l'exécution pour réutiliser les compétences de contrôle de robots humanoïdes sans réentraînement ?
InterEvolve leverages an object-aware forward-backward behavioral foundation model to map rewards into loco-manipulation behaviors at test time.
QUESTION — Comment réduire le surcoût en tokens et les appels LLM pour les agents de contrôle de robots basés sur des VLM tout en améliorant le taux de réussite ?
PyRUA-Lean increases overall success from 63.1% to 71.7% across 700 simulated task instances.
QUESTION — Les agents logiciels peuvent-ils accomplir des tâches d'ingénierie logicielle lorsque les informations opérationnelles requises ne sont disponibles que via l'interface visuelle de l'application en cours d'exécution ?
CUA-SWE fournit un banc d'essai unifié couvrant quatre domaines de l'ingénierie logicielle.
QUESTION — Quelles sont les capacités et les limites de GPT-6 Astra lorsqu'il agit en tant que politiques incarnées pour contrôler directement des robots dans diverses tâches ?
Le contrôle hybride avec π0.5 atteint 48 % de réussite sur le sous-ensemble RoboDojo évalué.
QUESTION — Comment optimiser la quantification du cache KV à faible nombre de bits à l'aide de transformations adaptées aux données pour minimiser l'erreur de reconstruction ?
WUSH-KV utilise des données d'étalonnage pour construire des transformations de clés et de valeurs distinctes.
QUESTION — Quelle architecture d'attention peut résoudre la saturation de la mémoire du cache KV et la complexité de calcul dans les modèles mondiaux vidéo ?
WorldAttention consistent surpass prior state-of-the-art methods, achieving subject consistency scores of 0.9472 on VBench-Long and 0.9668 on InterVBench, respectively.
QUESTION — Comment automatiser le développement de jeux à l'aide de cadres d'agents dotés de mécanismes d'auto-amélioration récursive ?
Notably, experience internalization enables Qwen3.8-27B to reach 61.38 on Godot and 58.53 on Phaser, exceeding GPT-5.5 one-shot scores while reducing Qwen's generation tokens by 11 times.
QUESTION — Comment étendre un modèle d'embedding textuel à de nouvelles modalités sans dégrader la qualité de la recherche textuelle ni nécessiter des milliards de paramètres ?
Omni-Embed-Mini-0.9B atteint 49.57 nDCG@10 sur MTEB-v2 BEIR-8.
QUESTION — Comment empêcher les récompenses à grande échelle de dominer la normalisation et de supprimer les signaux provenant de récompenses à plus petite échelle dans l'optimisation de politique relative de groupe multi-récompense?
CorrGRPO convertit les covariances par paires en coefficients de corrélation de Pearson pour équilibrer l'influence de récompenses d'échelles différentes.
QUESTION — Comment coupler la curation de catalogues et le post-entraînement pour améliorer la précision de recherche de produits en contexte long pour les petites entreprises?
La curation de contexte procure des gains allant jusqu'à 31.4 points de pourcentage en précision de recherche.
QUESTION — Comment évaluer des agents de données et des flux de travail analytiques sur des entrepôts de données à l'échelle de l'entreprise qui nécessitent de naviguer dans des schémas complexes et d'exécuter des actions consécutives?
Argo-Bench simule une plateforme de livraison de nourriture à New York avec 81 millions de commandes en 2024.
QUESTION — Comment isoler et évaluer systématiquement la capacité d'un agent IA à comprendre, manipuler et améliorer les données d'entraînement ?
L'article présente AutoDataBench, un banc d'essai contrôlé pour évaluer l'intelligence des données des agents IA. Le cadre se concentre sur le diagnostic, l'organisation et la construction des données à travers trois tâches d'optimisation tout en maintenant les facteurs non liés aux données constants. Il teste la capacité des LLM de pointe à améliorer les données d'entraînement par une experimentation itérative sous des budgets de ressources spécifiques.
QUESTION — Comment exploiter simultanément des modèles de prédiction dense comme cibles d'alignement pour la diffusion de pixels sans provoquer de conflits de gradients ?
PixelDense élève le GenEval Overall de PixelGen-XXL de 0.7927 à 0.8093.
QUESTION — Quelles structures de paramètres au sein des modèles vision-langage-action sont responsables des gains de performance lors du post-entraînement par apprentissage par renforcement ?
Le RL induit des mises à jour de paramètres de rang faible concentrées dans les modules Timestep de l'expert en action.
QUESTION — Comment réaliser une distillation unique pour des modèles de diffusion vidéo sous forme d'adaptateurs réutilisables sur divers modèles en aval ?
LongLive-Plug apprend des capacités réutilisables sous forme de LoRAs sur un modèle de base pour un déploiement plug-and-play sans entraînement.
QUESTION — Comment exploiter les états intermédiaires des boucles récurrentes dans les Transformers pour améliorer la qualité du décodage sans entraînement supplémentaire ?
LoopCD-Logits fait passer le pass@1 de AIME 2024 pour Ouro-2.6B-Thinking de 61,88 % à 73,33 %.
QUESTION — Comment appliquer avec succès l'apprentissage autosupervisé sur des flux vidéo continus sans sacrifier la qualité du modèle par rapport à l'échantillonnage indépendant traditionnel ?
WT++ est un ensemble de données vidéo de 95 heures construit pour le pré-entraînement en flux.
QUESTION — Quel est l'impact de la politique de déploiement, de la direction KL au niveau des tokens et du taux d'apprentissage sur la dynamique de distillation des modèles ?
Forward KL exhibits exceptional robustness to rollout policy changes.
QUESTION — Peut-on apprendre des connaissances professionnelles en matière d'aménagement à partir de véritables plans d'étage à l'aide d'un modèle pré-entraîné, permettant une génération de mise en page directe et consciente des contraintes sans dépendre d'une inférence agentique itérative coûteuse?
AntPlan est un ensemble de données de 505 vrais plans d'étage architecturaux professionnels avec des annotations de mobilier denses couvrant 92 classes d'objets et dix catégories de pièces résidentielles.