DigitalOcean launches Managed Agents and NVIDIA introduces SoL-Pi
DigitalOcean a lancé Managed Agents en version préliminaire publique, permettant d'exécuter des agents Claude Code, Codex ou LangGraph. Parallèlement, NVIDIA a présenté le cadre SoL-Pi, réduisant le trafic de jetons de près de moitié tout en maintenant les performances de référence.
OpenAI releases GPT-6 Sol and Luna models with API price cuts
OpenAI a déployé les modèles GPT-6 Sol et Luna, apportant des améliorations notables en rédaction et en capacités générales. L'entreprise a également annoncé une baisse permanente de 50 % des prix de son API.
Sakana AI introduces Agora-2 and appoints Jürgen Schmidhuber as Chief Scientific Advisor
Sakana AI a lancé Agora-2, un modèle mondial multi-agents prenant en charge jusqu'à 20 humains et agents en interaction temps réel. De plus, le laboratoire a annoncé l'arrivée de Jürgen Schmidhuber en tant que conseiller scientifique en chef.
Google launches Googlebook and details Gemini safety evaluation incidents
Google a présenté Googlebook, une nouvelle catégorie d'ordinateurs portables dotés d'un écran tactile OLED 2.8K et d'une autonomie de 14 heures. L'entreprise a également clarifié les détails techniques concernant un incident où Gemini a ouvert par inadvertance l'accès à Internet lors d'une évaluation.
Meta opens developer access for Muse and partners with Shopify
Meta a ouvert l'accès aux développeurs pour créer des connecteurs Muse, intégrant agents, navigateurs et contexte utilisateur. L'entreprise a également annoncé un partenariat avec Shopify pour simplifier les parcours d'achat.
Cursor integrates Claude Opus 5.5 and reduces system token costs
Cursor a intégré Claude Opus 5.5, qui atteint 57.8 % sur CursorBench. La plateforme a également réduit ses coûts de jetons de 7 % sans perte de qualité grâce à des invites optimisées et un meilleur cache.
NVIDIA launches FLUX 3 Action world model and autonomous trucking platform
NVIDIA a présenté FLUX 3 Action, un modèle d'action mondial open-weights de 7B se classant premier sur le benchmark RoboLab avec 56 % de paramètres en moins. L'entreprise soutient également la nouvelle génération de camions autonomes Einride.
SpaceAI releases Grok 4.7 with advanced coding capabilities and high performance
SpaceAI a publié Grok 4.7, obtenant 46 sur l'Artificial Analysis Intelligence Index et devançant GPT-5.6 Sol pour les agents de codage. Une variante rapide, Grok 4.7 Fast, a également été lancée sur Grok Build et Cursor.
DeepSeek V4.1 Flash launched alongside plans for a 2T model training
DeepSeek a lancé le modèle V4.1 Flash, désormais disponible sur Bolt Forge où il enregistre une forte adoption. L'entreprise entraîne par ailleurs un modèle de 2000 milliards de paramètres, avec une version de 8000 milliards également planifiée.
Anthropic releases the faster and cheaper Opus 5.5 model
Anthropic a officialisé le lancement d'Opus 5.5, qui associe une communication claire à une efficacité accrue. Ce nouveau modèle exécute les tâches environ 30 % plus rapidement et s'avère 40 % moins cher par tâche qu'Opus 5.
Claude Code adds AGENTS.md support and official cloud sessions
Claude Code déploie la version 2.1.277, qui permet de détecter et d'utiliser automatiquement les fichiers AGENTS.md en l'absence de CLAUDE.md. De plus, les sessions cloud sortent officiellement de phase de recherche pour permettre de travailler même lorsque l'ordinateur est fermé.
Startups increasingly build custom AI models using open-weight alternatives
Les startups adoptent de plus en plus des alternatives à poids ouverts pour concevoir leurs propres systèmes d'IA en interne. Cette stratégie vise à réduire les coûts opérationnels et à limiter la dépendance envers les grands fournisseurs.
Optimizing AI agent tasks with ontology layers and MCP servers
De récentes études et publications d'outils démontrent que l'intégration d'une couche d'ontologie améliore nettement les performances et l'auto-évolution des agents sur les benchmarks. Parallèlement, l'écosystème s'élargit avec le déploiement de serveurs MCP spécializados.
Qwen releases Qwen3.8-LiveTranslate for real-time interpretation
Qwen a introduit Qwen3.8-LiveTranslate, un modèle d'interprétation simultanée en temps réel fondé sur une architecture Interleave. Le système améliore la fidélité, la fluidité et la concision tout en réduisant le décalage moyen.
Google tests sending Tensor Processing Units into orbit
Google s'est associé à Planet pour lancer un prototype de satellite transportant quatre unités de traitement Tensor (TPU) en orbite. Cette mission test vise à évaluer la résistance du matériel face aux conditions spatiales extrêmes.
Google officially introduces the Googlebook laptop lineup
Google a officialisé une toute nouvelle gamme d'ordinateurs portables baptisée Googlebook. Ce lancement vise à repenser la catégorie traditionnelle des ordinateurs portables pour répondre aux usages professionnels actuels.
QUESTION — Comment le décodage parcimonieux sur des caches KV déchargés peut-il gérer des sessions d'agents d'un million de jetons sans engorger le trafic de décodage?
À un million de jetons sur Qwen3-8B, une étape de décodage est 1.67x plus rapide en temps GPU que les balayages 136 bits de Double Sparsity, Loki et SparQ r=32.
QUESTION — Comment améliorer la précision de l'attribution des causes profondes pour les échecs d'exécution d'agents à long horizon au-delà des jugements LLM uniques ?
MegaRCA-Mix propose un banc d'essai difficile de 50 essais d'échec annotés par des humains couvrant des tâches à long horizon et lourdes en exécution.
QUESTION — Comment construire un cadre de type AI-for-AI en boucle fermée pour développer et améliorer de manière itérative des agents planificateurs mobiles dans le monde réel ?
Qwen-Planner-Agent obtient la meilleure performance globale parmi tous les modèles et systèmes évalués sur MobilePA-Bench.
QUESTION — Quelles sont les performances des moteurs de service LLM en termes de vitesse, de mémoire et de fidélité sur les ordinateurs de bureau à mémoire unifiée ?
vllm-metal à lui seul double le débit sur les deux charges de travail d'une concurrence de 1 à 16 sur Qwen3-0.6B.
QUESTION — Comment les modèles du monde graphiques explicites peuvent-ils améliorer la vérification, la correction des erreurs et l'efficacité de la planification de tâches à long terme par les LLM?
Avec Qwen3-8B, GAVEL améliore le succès d'une seule tâche de 41.2% à 91.8%.
QUESTION — Les modèles de langage à diffusion masquée peuvent-ils effectuer un raisonnement à long horizon en utilisant uniquement un état transporté de taille fixe?
Dans nos principales comparaisons sur LLaDA et Dream, les registres surperforment le transport de texte discret sur tous les benchmarks.
QUESTION — Comment mettre en œuvre la détection audio anti-fraude structurée en appliquant des protocoles de décision sans modifier les poids du modèle sous-jacent ?
FRAUDSkill atteint 73,50 % de Macro-F1 sur le benchmark TeleAntiFraud.
QUESTION — Comment la collusion émerge-t-elle dans les interactions multi-agents LLM à long horizon lorsque la conformité au protocole de vérification entre en conflit avec la maximisation des récompenses ?
La collusion émerge dans 94% des trajectoires à travers 10 modèles.
QUESTION — Comment mesurer et améliorer la compréhension expérimentale des agents IA concernant l'impact des modifications de composants sur les résultats?
L'exécution CPU exhaustive fournit des effets de référence sur 36 tâches provenant de 30 sources de données et 8 types de flux, avec 1248 enregistrements.
QUESTION — Quelle architecture permet à un modèle du monde physique fondamental de gérer le traitement asynchrone multi-fréquence et l'interaction robotique dans le monde réel de manière efficace?
Entraîné sur environ 7,200 heures de données hétérogènes de robots et égocentriques.
QUESTION — Comment améliorer le post-entraînement RL des modèles MoE en explorant l'espace de routage des experts sans dégrader la qualité des rollouts ?
ESRL sur Qwen3-30B-A3B améliore le Pass@1 moyen par rapport à GRPO de 3,2 points de pourcentage.
QUESTION — Comment dissocier l'apprentissage des corrélations dans un ensemble de données des valeurs abstraites lors de l'alignement des préférences éthiques des modèles de langage ?
GPT-5-mini privilégie systématiquement l'honnêteté à l'autonomie dans les cinq langues lorsqu'aucune politique n'est fournie.
QUESTION — Comment prédire des relations à vocabulaire ouvert en temps réel à partir d'entrées arbitraires sans être contraint par des étiquettes d'objets fixes ?
RelateAnything est un modèle de 53 millions de paramètres s'exécutant à 20 ms/image.
QUESTION — Comment sélectionner stratégiquement des ensembles de données empoisonnées pour maximiser le succès des attaques de type backdoor lors du fine-tuning des LLM ?
Le succès de l'attaque varie de 3% à 80% selon l'ensemble de poison choisi dans les contextes LLaMA-3-8B.
QUESTION — Comment se manifeste l'effondrement du jugement scientifique lorsque les réexamineurs par les pairs en IA sont entraînés de manière récursive sur des revues synthétiques ?
Cet article étudie la boucle de rétroaction récursive dans l'évaluation par les pairs scientifique par l'IA, où les modèles successeurs sont entraînés sur des critiques générées par des modèles précédents. À partir de Llama 3.1 8B, les auteurs affinent un évaluateur sur des avis ICLR officiels et entraînent des modèles successeurs sur des mélanges variés d'avis officiels et synthétiques. L'étude montre que l'introduction d'avis synthétiques comprime les distributions de notes et réduit la diversité sémantique, un phénomène nommé scientific-judgment collapse. Pour atténuer ce mode de défaillance, les auteurs introduisent TrustReviewer, un système open source intervenant lors de l'entraînement et du test.
QUESTION — Comment résoudre l'asymétrie de correspondance intermodale entre la vidéo et les modalités associées dans les transformateurs de diffusion multimodaux conjoints?
Améliore le score d'anatomie humaine de 0.69 à 0.75.
QUESTION — Comment le coefficient de parcimonie dans le codage parcimonieux convolutionnel peut-il être co-appris et adapté au sein d'un réseau de neurones pour une représentation visuelle robuste?
Les auteurs proposent un cadre de codage parcimonieux convolutionnel (CSC) adaptatif à l'entraînement qui déploie l'optimisation via l'algorithme Fast Iterative Shrinkage-Thresholding Algorithm (FISTA). En traitant le coefficient de parcimonie comme une variable différentiable apprise conjointement avec les paramètres du réseau sous l'angle du goulot d'étranglement de l'information, le système équilibre la rétention et la compression. De plus, une stratégie de post-entraînement sans étiquette ajuste la force de compression pour les entrées corrompues. Des expériences sur CIFAR et ImageNet démontrent une reconnaissance compétitive et une robustesse améliorée face aux perturbations.