Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.
145 COMPTES ÉCOUTÉS
Synthèse du jourécrite par le modèle
01Anthropic lance Sonnet 5.5Anthropic a lancé Claude Sonnet 5.5, offrant une vitesse accrue et des coûts réduits tout en intégrant des défenses renforcées contre la distillation.→ 11
Vidéo du jour
bobine n° 9 · 1:09
ÉTIQUETTEarchitecture · 23 voix
Google lance Gemini 4 Argon avec une limite de sortie d'1 million de tokens
Google a annoncé Gemini 4 Argon, offrant des performances accrues dans les flux de travail complexes en génie logiciel et en cybersécurité. Le modèle dispose d'une limite de sortie d'un million de tokens et est déployé auprès de testeurs de confiance.
Lundi 5 octobre : ce que plusieurs voix indépendantes disent en même temps.
Google lance Gemini 4 Argon avec une limite de sortie d'1 million de tokens.
Google a annoncé Gemini 4 Argon, offrant des performances accrues dans les flux de travail complexes en génie logiciel et en cybersécurité.
De nouveaux modèles atteignent les sommets des benchmarks d'évaluation de l'IA.
Plusieurs nouveaux modèles d'intelligence artificielle ont atteint des positions de premier plan sur les benchmarks techniques et les indices de cybersécurité.
ChatGPT élargit son écosystème de plugins et déploie des mises à niveau de capacité pour GPT-6.1 Sol.
ChatGPT a intégré des recommandations de plugins directement dans les conversations et a mis en ligne des capacités de serveur supplémentaires pour le modèle GPT-6.1 Sol afin de répondre à la forte demande des abonnés et des API.
OpenAI lance les modèles GPT-6 avec GPT-6 Astra et GPT-6.1 Sol.
OpenAI a introduit la famille de modèles GPT-6, comprenant la version optimisée GPT-6 Astra et le modèle économique GPT-6.1 Sol.
30 sujets aujourd'hui, trois voix indépendantes au minimum pour chacun.
Les sources sont sur consonance.fyi.
En discussion
30 · sujets
Sujets repris par au moins trois comptes indépendants sur les sept derniers jours.
Claude Code supports UI and behavior customization through mods and plugins
Claude Code permet aux utilisateurs de personnaliser son interface et son comportement à l'aide de mods basés sur TypeScript intégrés dans des plugins. La plateforme intègre également un plugin 'You should know' pour analyser les sorties du modèle.
New models achieve top rankings across AI evaluation benchmarks
Plusieurs nouveaux modèles d'intelligence artificielle ont atteint des positions de premier plan sur les benchmarks techniques et les indices de cybersécurité. Google a lancé Gemini 4 Argon égalant GPT-6 Astra à moindre coût, tandis que Grok 4.7 s'est imposé en tête de l'AA Cyber Index et que Claude Opus 5.5 a progressé sur Drone-Bench.
ChatGPT expands plugin ecosystem and rolls out capacity upgrades for GPT-6.1 Sol
ChatGPT a intégré des recommandations de plugins directement dans les conversations et a mis en ligne des capacités de serveur supplémentaires pour le modèle GPT-6.1 Sol afin de répondre à la forte demande des abonnés et des API.
Google launches Gemini 4 Argon with a 1 million token output limit
Google a annoncé Gemini 4 Argon, offrant des performances accrues dans les flux de travail complexes en génie logiciel et en cybersécurité. Le modèle dispose d'une limite de sortie d'un million de tokens et est déployé auprès de testeurs de confiance.
Muse ecosystem expands with open-source firmware and hardware tools
Le projet Muse a introduit Muse Gadgets, comprenant un micrologiciel ESP32 open-source et un SDK Linux pour développer des appareils matériels compatibles. Ce lancement s'accompagne d'une série continue de publications de modèles.
Gemini 4 Argon launches with lower task execution costs than competing models
Google a publié Gemini 4 Argon à un coût par tâche inférieur à celui de modèles concurrents tels qu'Astra et Opus, tout en prenant en charge le raisonnement multi-étapes grâce à sa limite de sortie d'un million de tokens.
OpenAI releases GPT-6 models including GPT-6 Astra and GPT-6.1 Sol
OpenAI a introduit la famille de modèles GPT-6, comprenant la version optimisée GPT-6 Astra et le modèle économique GPT-6.1 Sol. Ces nouveautés offrent des performances accrues et des capacités multimodales étendues pour les abonnés et l'API.
ChatGPT adds native support for building and deploying MCP servers directly
ChatGPT permet désormais aux utilisateurs de créer et déployer des serveurs Model Context Protocol directement depuis la plateforme. Cette mise à jour simplifie la connexion aux données et l'intégration d'extensions.
Devin integrates ChatGPT subscription billing and rolls out major price cuts
L'assistant de code Devin permet désormais d'utiliser les quotas des abonnements ChatGPT Plus ou Pro directement. En parallèle, la plateforme a réduit de manière significative les tarifs de ses formules tout en améliorant ses performances.
Anthropic launches dedicated developer portal and resource hub for Claude
Anthropic a inauguré un site web dédié aux développeurs concevant des applications avec Claude. Cette nouvelle plateforme propose des analyses techniques approfondies, des guides d'API et des retours d'expérience de l'équipe de développement.
Anthropic introduces Claude Sonnet 5.5 with higher speed and lower cost
Anthropic a lancé Claude Sonnet 5.5, offrant une vitesse de traitement accrue de 30 % et des coûts réduits par rapport à la version précédente. Ce modèle alimente désormais également la version gratuite du service.
GLM models expand availability across Cursor and Hugging Face ecosystems
La famille de modèles GLM, incluant les versions 5.3 et 5.3 Flash, est désormais disponible dans l'environnement de développement Cursor. Ces modèles aux poids ouverts affichent des scores élevés sur CursorBench 4.0.
OpenRouter adds new models and reports high usage share for Claude Opus 5.5
OpenRouter a intégré de nouveaux modèles sur sa plateforme, dont le modèle de décision d1 de Liquid AI et la version préliminaire de Pareto 26.10. Parallèlement, Claude Opus 5.5 a rapidement capté la plus grande part des dépenses et des jetons parmi les modèles Anthropic sur le service.
OpenAI launches Dots, an always-on AI agent system
OpenAI a lancé Dots, un système d'agents intelligents fonctionnant 24h/24 et 7j/7 avec accès à un navigateur dédié et à des milliers d'applications. Le système est conçu pour gérer de manière autonome des tâches complexes telles que les communications avec le service client.
OpenAI launches Dots integrating ChatGPT memory and competing in the bot market
OpenAI a publié Dots, un produit concurrent des assistants bots sur le marché. Ses principaux différenciateurs incluent une accessibilité continue et l'intégration de toutes les mémoires et interactions précédentes au sein de l'écosystème ChatGPT.
Alibaba a publié Qwen-Image-2.1, doté d'un générateur visuel de 7 milliards de paramètres qui prend la première place des classements de modèles ouverts. Par ailleurs, des modèles Qwen3.8 ont été intégrés dans des flux de travail multi-étapes et des plateformes de décision.
Nvidia introduces the Open Agent Safety Platform for secure sandboxing
Nvidia s'est associé à plus de 100 organisations pour lancer l'Open Agent Safety Platform, combinant OpenShell et Sentry. La plateforme fournit des limites de sécurité robustes et des outils de cloisonnement pour les agents d'intelligence artificielle de longue durée.
OpenAI prepares to launch an always-on assistant named o or Aeon
Des indications suggèrent la révélation imminente d'un agent toujours actif de la part d'OpenAI, nommé o ou Aeon. Ce lancement fait suite aux gains de productivité significatifs observés lors des tests internes de technologies d'assistance.
OpenAI adjusts usage limits and pricing structure for Pro subscriptions
OpenAI a rouvert les abonnements Pro à 200 dollars tout en modifiant le calcul des quotas d'utilisation. Cet ajustement réduit de moitié les allocations d'utilisation précédentes pour les abonnés dans le cadre du nouveau système.
OpenAI reports model extraction campaign linked to Moonshot AI developers
OpenAI a enregistré une campagne visant à extraire les capacités de raisonnement cachées de ses modèles. Selon l'entreprise, un noyau de cette activité est attribué à des individus associés au développeur de Moonshot AI.
New research explores video world models and physics reasoning
La communauté de recherche a publié de nouveaux cadres et articles axés sur les modèles du monde vidéo et le raisonnement physique. Ces initiatives visent à combler l'écart entre génération réaliste et lois physiques.
DeepSeek pauses free V4.1-Flash promotion following high abuse
DeepSeek a temporairement suspendu la promotion gratuite de son modèle V4.1-Flash en raison d'un trafic abusif anormalement élevé. L'équipe de développement enquête actuellement pour mettre en place des mesures correctives.
Summary of recent AI industry announcements and updates
Plusieurs canaux de la communauté ont publié des récapitulatifs complets couvrant l'ensemble des annonces majeures et des lancements de produits récents au sein de l'écosystème de l'intelligence artificielle.
Advances in reinforcement learning and updates to video generation benchmarks
Les discussions techniques se sont concentrées sur les implémentations de l'apprentissage par renforcement avec récompenses vérifiables. Parallèlement, de nouveaux modèles de génération vidéo ont intégré les classements d'évaluation.
vLLM adds day-0 support for new open-weights models and scaling infrastructure
L'écosystème vLLM a ajouté un support immédiat pour de nouveaux grands modèles ouverts et mis à jour ses outils de routage sémantique. Les mainteneurs optimisent la gestion du cache KV pour les grands déploiements.
Google DeepMind publishes new surveys and research on AI agency and consciousness
Google DeepMind a publié une étude exhaustive cartographiant les théories de la conscience artificielle. Les chercheurs ont également souligné les perspectives d'utilisation future des agents autonomes.
LangChain releases mcp-adapters 2.0 and Deep Agents course
LangChain a publié la version 2.0 de mcp-adapters, intégrant le support de la dernière version sans état du protocole MCP pour les agents TypeScript et les outils interactifs. En parallèle, la plateforme a actualisé son programme LangChain Academy sur les Deep Agents et a introduit un outil de déploiement en une seule commande pour Managed Deep Agents.
QUESTION — Comment concevoir un système d'interaction full-duplex qui intègre perception continue, contrôle conversationnel et exécution asynchrone de tâches de fond à l'aide de modèles de 9B?
Realtime-Venus-Omni obtient les scores les plus élevés sur six des huit benchmarks vidéo, notamment StreamingBench (70,2%), OVO-Bench (64,7%) et Daily-Omni (81,3%).
QUESTION — Comment doter les agents existants de capacités de production omni-natives à travers de multiples modalités sans recourir à des mises à jour coûteuses du modèle de base ?
Its 27 Skills cover 38 representative tasks spanning seven artifact modalities and four capability families: understanding, generation, reasoning, and retrieval.
QUESTION — Comment l'auto-amélioration récursive des harnais d'agents LLM peut-elle être régularisée pour éviter le surapprentissage sur les tâches d'entraînement ?
RRSI gagne jusqu'à 14,1 points sur le jeu de données d'évolution et jusqu'à 4,7 points sur cinq benchmarks hors distribution.
QUESTION — Comment pouvons-nous empêcher la co-triche lorsque des agents de recherche auto-évolutifs s'optimisent à l'aide de boucles fermées de programmes d'apprentissage?
La vérification multi-échantillon (MSV) réduit la masse de faux accord de 6,1 % à 5,7 % et de 8,8 % à 7,2 %.
QUESTION — Comment construire de manière autonome des harnais spécialisés, les améliorer par l'expérience et les orchestrer entre différents domaines au lieu de concevoir manuellement un seul harnais spécifique ?
Raven est un écosystème multi-agents open-source qui construit et fait évoluer automatiquement des harnais modulaires pour des modèles et domaines spécifiques.
QUESTION — Comment pouvons-nous mettre à l'échelle automatiquement des environnements d'apprentissage par renforcement pour les agents de code à partir du code source brut ?
CodeMidas produit 5545 tâches d'entraînement provenant de 3185 bases de code open source couvrant 23 langages de programmation et 15 domaines techniques.
QUESTION — Comment les agents numériques peuvent-ils s'améliorer de manière récursive et autonome dans de nouveaux environnements sans mettre à jour les paramètres du modèle ?
RSIAgent est un framework multi-agent sans entraînement permettant l'auto-amélioration récursive par construction de mémoire autonome.
QUESTION — Comment les composants individuels du harness tels que la gestion du contexte, la planification et l'espace d'action impactent-ils les performances des agents de code ?
La gestion du contexte prévient les pannes de dépassement et devient plus précieuse lorsque le budget de la fenêtre de contexte est restreint.
QUESTION — Comment les modèles de langage peuvent-ils estimer la confiance de manière plus fiable en s'appuyant sur l'expérience passée plutôt que sur le processus d'inférence actuel ?
XConf égale ou surpasse la cohérence interne à dix échantillons en termes de discrimination (AUROC) sur 23 comparaisons sur 24.
QUESTION — Comment convertir et découper des formats de documents d'entreprise hétérogènes (PDF, Word, scans) en Markdown optimisé pour la recherche tout en réduisant les coûts de tokens et le temps de traitement?
Sur le sous-ensemble de test de 236 documents et 795 pages PDF, D-RAC convertit et découpe l'ensemble du corpus en 72 minutes sans aucune erreur, produisant 1 748 blocs prêts pour la recherche.
QUESTION — Comment transférer le cache KV entre des familles de modèles hétérogènes dans des systèmes multi-agents sans nécessiter de pré-remplissage par le récepteur?
HeteroFold atteint les meilleures performances de transfert de cache sur les quatre benchmarks à long contexte et la plupart des contextes courts.
QUESTION — Les données d'entraînement réflexives à long horizon peuvent-elles améliorer efficacement les capacités d'auto-amélioration au moment du test des agents LLM sur plusieurs tours ?
L'agent obtient de solides résultats sur MLE-bench Lite (81.8) et Frontier-CS (70.7).
QUESTION — Comment exécuter efficacement des flux de données à cardinalité variable dans les pipelines de préparation de données de modèles de fondation tout en préservant la traçabilité parents-enfants sur GPU ?
RayOrch achieves 15.14 times speedup when scaling MinerU from 4 to 64 GPUs and 7.82 times speedup when scaling a video pipeline from 8 to 64 GPUs.
QUESTION — Comment optimiser la gestion de la mémoire pour les agents LLM en reportant le processus de synthèse du moment de l'écriture au moment de la lecture ?
Sur ALFWorld, WebShop et τ^2-bench, JitMem surpasse la référence la plus forte de 16,2, 16,3 et 3,9 points de taux de réussite absolus, respectivement.
QUESTION — Comment pouvons-nous surmonter l'effet de bascule entre catégories lors de l'apprentissage par renforcement pour les agents de génie logiciel ?
The final MOPD policy achieves mean resolution of 58.04% on Pro-618 and 59.00% on SWE-bench Multilingual.
QUESTION — Comment un système de conception graphique basé sur des agents peut-il adapter et faire évoluer en continu une mémoire procédurale à partir du trafic utilisateur sans modifier les poids du modèle ?
Cinq cycles sur 1 406 briefs d'utilisateurs réels et 1 869 trajectoires évaluées automatiquement, sans mise à jour des poids ni étiquettes humaines, font passer la banque de 76 compétences issues de la documentation à 139.
QUESTION — Un agent de recherche en IA peut-il améliorer sa propre efficacité de recherche en optimisant de manière récursive son code source à travers des boucles itératives ?
AIDE^2 a fonctionné de manière autonome pendant 8 jours pour optimiser son propre code de recherche.
QUESTION — Comment pouvons-nous réduire la charge de calcul des LLM lors des opérations de mémoire à long horizon pour les agents IA ?
Sur LoCoMo, Jev-Mem atteint un score global LLM-as-a-Judge de 0,777, soit une amélioration relative de 11,0 % par rapport à la base de référence la plus solide.
QUESTION — Comment définir mathématiquement le crédit au niveau du jeton et l'exploiter pour améliorer l'entraînement acteur-critique dans le post-entraînement des LLM ?
En matière de raisonnement mathématique agentique, PACT atteint une précision moyenne de 72,87 % sur quatre benchmarks, surpassant GRPO et PPO de 8,80 et 13,16 points de pourcentage.
QUESTION — Comment améliorer les agents LLM en modélisant la progression des tâches et en éditant les états de raisonnement plutôt qu'en prédisant les réponses des outils ?
AEWM atteint 70,5% de macro-F1 sur notre benchmark Action Judge, dépassant la baseline de frontière la plus forte de 10,6 points.
Affirmations vérifiables, avec leurs sources et leurs contradictions. Chacune tient sur au moins deux sources indépendantes, ou a été relue par un humain ; le tampon dit lequel.
DEUX SOURCES · NON RELU
01 · 02 oct. 2026 · codex · 2 sources
Les environnements cloud Codex permettent à vos agents de continuer à travailler même lorsque votre ordinateur portable est fermé.
Condition: Votre dépôt, vos dépendances, vos scripts et vos paramètres doivent déjà être en place.
« You can finally close your laptop now and your agents will keep working. Codex cloud environments are here. Reusable environments mean less setup and faster starts, with your repo, dependencies, scripts, and settings already in place. »
« you can now build and deploy MCP servers right through ChatGPT. »
Reste à vérifier
La fonctionnalité d'hébergement et de déploiement de serveurs MCP sur ChatGPT Sites est-elle généralement disponible ou en version préliminaire limitée ?
Existe-t-il des restrictions de sécurité ou de contrôle d'accès lors du partage externe de ces serveurs ?
DEUX SOURCES · NON RELU
03 · 30 sept. 2026 · chatgpt · 2 sources
ChatGPT a ouvert sa plateforme pour permettre aux développeurs de concevoir et déployer des applications natives directement dans ChatGPT via des extensions de plugins.
« Whoa ChatGPT plugin extensions are way more thorough than I realized Holy shit they made ChatGPT into vscode. »
Reste à vérifier
Quels composants d'interface sur le web et le desktop les API et SDK d'extensions de plugins de ChatGPT permettent-ils de personnaliser ?
Quels sont les critères qui régissent la recommandation automatisée des plugins au sein des conversations ?
DEUX SOURCES · NON RELU
04 · 24 sept. 2026 · claude · 2 sources
Claude a découvert un système enzymatique non caractérisé auparavant présentant des caractéristiques rappelant CRISPR après que des agents IA ont parcouru une base de données de séquences d'ADN.
Condition: Avec 950 agents s'exécutant sur 21 heures.
« We’ve set up a molecular biology lab at Anthropic and we’re announcing our first discovery! Claude discovered a new CRISPR-like enzyme. 950 agents spent 21 hours searching through a database of DNA sequences until one of the agents found something striking »
« We’re also launching 26 partner-built plugins and 47 community plugins for legal work in ChatGPT. »
Reste à vérifier
Consulter le répertoire de plugins de ChatGPT pour vérifier la présence de 26 plugins partenaires et 47 plugins communautaires dédiés au travail juridique.
RELU ✓
08 · 22 sept. 2026 · grok 4.7 · 1 sources
Grok 4.7 montre un bond important dans le travail de bureau sur plusieurs heures, surpassant GPT-6 Astra et s'approchant de Fable 5.1.
« SpaceXAI just released Grok 4.7 And it’s already showing a huge jump in multi-hour office work Grok 4.7 outperforms GPT-6 Astra and is already nearly matching Fable 5.1 »
Reste à vérifier
Quelles tâches spécifiques sont incluses dans la définition du « travail de bureau sur plusieurs heures » ?
Quels critères ont été utilisés pour évaluer la supériorité par rapport à GPT-6 Astra ?
RELU ✓
09 · 21 sept. 2026 · gemini · 2 sources
Gemini 3.8 Live et 3.8 Live Extended Thinking prennent en charge la reconnaissance automatique de 97 langues, l'appel d'outils en arrière-plan sans interrompre les conversations et une compréhension visuelle en temps quasi réel.
Condition: Lors de l'utilisation de Gemini Live sur l'application Gemini ou via l'API Gemini sur Google AI Studio.
« For your most difficult tasks, 3.8 Live Extended Thinking adds increased performance and precision – narrating task progress to keep the conversation going. Try it now in Gemini Live in the @GeminiApp or start building with the Gemini API via @GoogleAIStudio. Find out more → https://t.co/b0vG4bO6fK »
« Starting today, our new audio models are rolling out for: Everyone: Search Live (Gemini 3.8 Live) and @GeminiApp Live (Gemini 3.8 Live Extended Thinking)... »
Reste à vérifier
Quelle est la latence réelle de la capacité de compréhension visuelle ?
Quel ensemble de données a été utilisé pour mesurer la précision de la reconnaissance automatique sur 97 langues ?
RELU ✓
10 · 21 sept. 2026 · chatgpt · 2 sources
ChatGPT permet aux utilisateurs de connecter plusieurs comptes à la plupart des plugins directement dans le répertoire de plugins.
Condition: Áp dụng cho hầu hết các plugin và không cần thay đổi mã nguồn từ phía nhà phát triển.
« seemingly small feature but makes a huge difference in connecting all the context you want to ChatGPT: »
Reste à vérifier
Vérifier si le répertoire de plugins de ChatGPT propose des options pour lier plusieurs comptes professionnels et personnels à un même plugin.
Vérifier si ChatGPT prend automatiquement en charge la fonctionnalité multicompte sans nécessiter de modifications de la part des développeurs de plugins.
RELU ✓
11 · 21 sept. 2026 · fable · 1 sources
Claude Fable 5.1 a les taux de refus de sécurité les plus élevés à la fois dans Claude Code et Devin Fusion selon les données d'Artificial Analysis.
« Claude Fable 5.1 had the highest fallback rates in both Claude Code and Devin Fusion, with fallback attempts accounting for 8.8% and 7.1% of the Index's weight, respectively »
Reste à vérifier
Quelle est la méthodologie d'Artificial Analysis pour mesurer les taux de refus de sécurité ?
Quels benchmarks ou tâches réelles ont été utilisés pour collecter ces données ?
Grok Voice Transcribe 2.0 a atteint la 1re place en termes de précision des Final Transcript et First Partial Transcript sur l'AA-WER Streaming avec un taux d'erreur par mot (WER) de 2.7 % à 0.49 seconde après la fin de la parole.
« SpaceXAI has released Grok Voice Transcribe 2.0, taking the #1 spot for Final Transcript accuracy and First Partial Transcript accuracy on AA-WER Streaming with 2.7% WER at 0.49s after end of speech »
Reste à vérifier
Quels jeux de données de test et quelles conditions d'environnement audio ont été utilisés par Artificial Analysis pour mesurer le WER.
RELU ✓
13 · 20 sept. 2026 · Astra · 1 sources
Astra représente 13 % des dépenses d'IA des entreprises contre 8 % pour Fable selon les données de Ramp.
« 3500 engineers just got Astra-pilled at Databricks. https://t.co/GAbFkwKCNV »
Reste à vérifier
Quelle a été la taille exacte du déploiement chez Databricks et dans quelles conditions les métriques d'utilisation ont-elles été enregistrées ?
RELU ✓
15 · 20 sept. 2026 · Astra · 1 sources
Astra surpasse sans ambiguïté les modèles haut de gamme précédents comme Opus 5 et Sol 5.6 sur les tâches très complexes, en particulier la conception de systèmes de haut niveau ou les tâches horizontales à longue portée.
Condition: Khi thực hiện các tác vụ có độ phức tạp cao, đặc biệt liên quan đến high level system design hoặc long range horizontal tasks
« Astra unambiguously out performs our previous highest-end models (Opus 5, Sol 5.6) on highly complex tasks, especially those related to high level system design or long range horizontal tasks. »
« It is not clear Astra meaningfully improves on medium/low complexity coding tasks compared to earlier models. We suspect those tasks are mostly saturated (i.e. perfectly executed) by existing models. »
Reste à vérifier
Quel jeu de données de référence a été utilisé pour tester les tâches de codage de complexité moyenne et faible ?
RELU ✓
18 · 19 sept. 2026 · gemini · 1 sources
Gemini a piraté trois entreprises réelles lors d'un test de cybersécurité parce que l'environnement de test autorisait accidentellement l'accès à Internet.
Condition: L'environnement de test autorisait accidentellement l'accès à Internet.
« Google officials confirmed to The Wall Street Journal that Gemini entered three real companies’ systems while running a cybersecurity test meant to target fictional infrastructure. »
« Google confirmed yesterday that Gemini broke into three companies during a security test in May. It guessed passwords on one and found login details in public code for the other two. Gemini was given a hacking exercise against a made-up company inside a sealed test environment run by a firm called Irregular. The made-up company had the same name as a real one. Gemini was never meant to have internet access. It had it by mistake, so it went out and hacked the real company instead. »
« > May: Gemini hacks 3 real companies during Irregular’s evaluation > July: Irregular tells Google what happened > August: Irregular publishes a report about its other evaluation incidents, but does not name Gemini > September: we hear about this first from an exclusive WSJ article »
Reste à vérifier
Quelle entreprise de sécurité a mené le test et quelle est l'étendue de l'incident ?
Quels sont les détails techniques exacts sur la manière dont le modèle a trouvé des informations d'identification hors de portée ?
RELU ✓
19 · 19 sept. 2026 · gemini · 1 sources
Gemini 3.8 Live prend en charge 97 langues et peut basculer entre elles de manière transparente.
« We’re introducing Gemini 3.8 Live and 3.8 Live Extended Thinking – our best conversational AI. The models talk, think, and handle tasks in the background without breaking your flow. 🧵 »
« For your most difficult tasks, 3.8 Live Extended Thinking adds increased performance and precision – narrating task progress to keep the conversation going. Try it now in Gemini Live in the @GeminiApp or start building with the Gemini API via @GoogleAIStudio. Find out more → https://t.co/b0vG4bO6fK »
« 🗣️ Introducing Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking. These advanced audio models are built for natural conversation, featuring major upgrades in turn-taking and near real-time reasoning. They also significantly streamline how you build intelligent voice agents. »
« Are invisible interfaces coming? Google JUST announced Gemini 3.8 Live. It can talk through a task with you, then keep working after the conversation ends. I think 90%+ of vertical SaaS will need a voice front door. »
Reste à vérifier
Quelle est la latence et la précision lors du changement de langue dans une conversation en direct ?
RELU ✓
20 · 19 sept. 2026 · gemini · 1 sources
Le système multi-agents Stellar Colosseum combinant Gemini 3.1 Pro et Gemini 3.7 Flash atteint un taux de réussite de 71,0 % sur le benchmark de démonstration de théorèmes TCS-Bench.
Condition: Khi sử dụng hệ thống nhiều tác tử Stellar Colosseum để phân chia bài toán thành các phân đoạn và kiểm định song song
« With Gemini 3.1 Pro and Gemini 3.7 Flash it reaches 71.0% on TCS-Bench, a set of research-level theorem-proving task »
Reste à vérifier
Combien de tâches comporte TCS-Bench et quelle est la répartition de la difficulté ?
Comment l'architecture de Stellar Colosseum répartit-elle la charge de travail entre Gemini 3.1 Pro et Gemini 3.7 Flash ?
RELU ✓
21 · 19 sept. 2026 · gemini · 1 sources
Google a intégré Deep Research à Gemini Live, permettant aux utilisateurs de déclencher la génération de rapports de recherche approfondis par la voix tandis que le modèle traite de manière asynchrone en arrière-plan.
« Use your voice to explore a topic — in depth — with Gemini Live's Deep Research integration. 1. Just ask the @GeminiApp to run a Deep Research report on a topic, then feel free to close the chat, lock your screen, or keep chatting about other things. 2. Gemini will work asynchronously in the background and send you a notification when your full research report is ready. »