CONSONANCE.for your information
lundi 5 octobre 2026frenvi
FICHE N° 2026-10-05RADAR IA & AGENTS

Trois voix, et ça devient une nouvelle.

Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.

145 COMPTES ÉCOUTÉS
Synthèse du jourécrite par le modèle
  1. 01 Anthropic lance Sonnet 5.5Anthropic a lancé Claude Sonnet 5.5, offrant une vitesse accrue et des coûts réduits tout en intégrant des défenses renforcées contre la distillation.→ 11

Vidéo du jour

bobine n° 9 · 1:09
ÉTIQUETTEarchitecture · 23 voix

Google lance Gemini 4 Argon avec une limite de sortie d'1 million de tokens

Google a annoncé Gemini 4 Argon, offrant des performances accrues dans les flux de travail complexes en génie logiciel et en cybersécurité. Le modèle dispose d'une limite de sortie d'un million de tokens et est déployé auprès de testeurs de confiance.

GÉNÉRÉE AUTOMATIQUEMENT
Transcription

Consonance, bobine n° 9.

Lundi 5 octobre : ce que plusieurs voix indépendantes disent en même temps.

Google lance Gemini 4 Argon avec une limite de sortie d'1 million de tokens.

Google a annoncé Gemini 4 Argon, offrant des performances accrues dans les flux de travail complexes en génie logiciel et en cybersécurité.

De nouveaux modèles atteignent les sommets des benchmarks d'évaluation de l'IA.

Plusieurs nouveaux modèles d'intelligence artificielle ont atteint des positions de premier plan sur les benchmarks techniques et les indices de cybersécurité.

ChatGPT élargit son écosystème de plugins et déploie des mises à niveau de capacité pour GPT-6.1 Sol.

ChatGPT a intégré des recommandations de plugins directement dans les conversations et a mis en ligne des capacités de serveur supplémentaires pour le modèle GPT-6.1 Sol afin de répondre à la forte demande des abonnés et des API.

OpenAI lance les modèles GPT-6 avec GPT-6 Astra et GPT-6.1 Sol.

OpenAI a introduit la famille de modèles GPT-6, comprenant la version optimisée GPT-6 Astra et le modèle économique GPT-6.1 Sol.

30 sujets aujourd'hui, trois voix indépendantes au minimum pour chacun.

Les sources sont sur consonance.fyi.

En discussion

30 · sujets

Sujets repris par au moins trois comptes indépendants sur les sept derniers jours.

01 — agents · 3e jour 6 VOIX

Claude Code prend en charge la personnalisation de l'interface et du comportement via des plugins

Claude Code supports UI and behavior customization through mods and plugins

Claude Code permet aux utilisateurs de personnaliser son interface et son comportement à l'aide de mods basés sur TypeScript intégrés dans des plugins. La plateforme intègre également un plugin 'You should know' pour analyser les sorties du modèle.

6 comptes indépendants 16 messages 1 articles 1 labos 130 844 interactions
@ClaudeDevs ses sujets sur X ↗
@HamelHusain ses sujets sur X ↗
@addyosmani ses sujets sur X ↗
@amorriscode ses sujets sur X ↗
@bcherny ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@trq212 ses sujets sur X ↗
02 — evaluation NOUVEAU 15 VOIX

De nouveaux modèles atteignent les sommets des benchmarks d'évaluation de l'IA

New models achieve top rankings across AI evaluation benchmarks

Plusieurs nouveaux modèles d'intelligence artificielle ont atteint des positions de premier plan sur les benchmarks techniques et les indices de cybersécurité. Google a lancé Gemini 4 Argon égalant GPT-6 Astra à moindre coût, tandis que Grok 4.7 s'est imposé en tête de l'AA Cyber Index et que Claude Opus 5.5 a progressé sur Drone-Bench.

15 comptes indépendants 139 messages 2 articles 7 labos 224 487 interactions
anthropicgooglegroknvidiaastradeepseekclaude opusclaude sonnet
@AlexFinn ses sujets sur X ↗
@AndrewCurran_ ses sujets sur X ↗
@AravSrinivas ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@ClaudeDevs ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
03 — system_design · 2e jour 15 VOIX

ChatGPT élargit son écosystème de plugins et déploie des mises à niveau de capacité pour GPT-6.1 Sol

ChatGPT expands plugin ecosystem and rolls out capacity upgrades for GPT-6.1 Sol

ChatGPT a intégré des recommandations de plugins directement dans les conversations et a mis en ligne des capacités de serveur supplémentaires pour le modèle GPT-6.1 Sol afin de répondre à la forte demande des abonnés et des API.

15 comptes indépendants 94 messages 4 labos 268 300 interactions
chatgpt
@AndrewBolis ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
@ajambrosino ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
04 — architecture · 3e jour 23 VOIX

Google lance Gemini 4 Argon avec une limite de sortie d'1 million de tokens

Google launches Gemini 4 Argon with a 1 million token output limit

Google a annoncé Gemini 4 Argon, offrant des performances accrues dans les flux de travail complexes en génie logiciel et en cybersécurité. Le modèle dispose d'une limite de sortie d'un million de tokens et est déployé auprès de testeurs de confiance.

23 comptes indépendants 127 messages 2 articles 8 labos 403 986 interactions
codexgeminigemini 3.8claude codeopencodesoraveocursor
@ArtificialAnlys ses sujets sur X ↗
@GeminiApp ses sujets sur X ↗
@Google ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@VibeMarketer_ ses sujets sur X ↗
05 — multimodal · 4e jour 10 VOIX

L'écosystème Muse s'élargit avec un micrologiciel open-source et des outils matériels

Muse ecosystem expands with open-source firmware and hardware tools

Le projet Muse a introduit Muse Gadgets, comprenant un micrologiciel ESP32 open-source et un SDK Linux pour développer des appareils matériels compatibles. Ce lancement s'accompagne d'une série continue de publications de modèles.

10 comptes indépendants 63 messages 1 articles 1 labos 73 260 interactions
muse spark
@AIatMeta ses sujets sur X ↗
@AlexFinn ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
@VibeMarketer_ ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
06 — inference NOUVEAU 7 VOIX

Gemini 4 Argon est lancé avec des coûts d'exécution inférieurs à ceux des modèles concurrents

Gemini 4 Argon launches with lower task execution costs than competing models

Google a publié Gemini 4 Argon à un coût par tâche inférieur à celui de modèles concurrents tels qu'Astra et Opus, tout en prenant en charge le raisonnement multi-étapes grâce à sa limite de sortie d'un million de tokens.

7 comptes indépendants 13 messages 1 articles 2 labos 185 750 interactions
@AndrewCurran_ ses sujets sur X ↗
@GoogleDeepMind ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@MatthewBerman ses sujets sur X ↗
@demishassabis ses sujets sur X ↗
@eptwts ses sujets sur X ↗
@godofprompt ses sujets sur X ↗
@iScienceLuvr ses sujets sur X ↗
07 — architecture · 2e jour 15 VOIX

OpenAI lance les modèles GPT-6 avec GPT-6 Astra et GPT-6.1 Sol

OpenAI releases GPT-6 models including GPT-6 Astra and GPT-6.1 Sol

OpenAI a introduit la famille de modèles GPT-6, comprenant la version optimisée GPT-6 Astra et le modèle économique GPT-6.1 Sol. Ces nouveautés offrent des performances accrues et des capacités multimodales étendues pour les abonnés et l'API.

15 comptes indépendants 68 messages 2 articles 5 labos 179 626 interactions
gpt-6xai
@AndrewCurran_ ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@MatthewBerman ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
08 — system_design · 4e jour 12 VOIX

ChatGPT ajoute le support natif pour créer et déployer des serveurs MCP directement

ChatGPT adds native support for building and deploying MCP servers directly

ChatGPT permet désormais aux utilisateurs de créer et déployer des serveurs Model Context Protocol directement depuis la plateforme. Cette mise à jour simplifie la connexion aux données et l'intégration d'extensions.

12 comptes indépendants 36 messages 1 articles 6 labos 46 192 interactions
model context protocol
@AravSrinivas ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@c_valenzuelab ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@godofprompt ses sujets sur X ↗
@huggingface ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
09 — agents NOUVEAU 4 VOIX

Devin intègre la facturation des abonnements ChatGPT et baisse ses tarifs

Devin integrates ChatGPT subscription billing and rolls out major price cuts

L'assistant de code Devin permet désormais d'utiliser les quotas des abonnements ChatGPT Plus ou Pro directement. En parallèle, la plateforme a réduit de manière significative les tarifs de ses formules tout en améliorant ses performances.

4 comptes indépendants 25 messages 1 labos 97 875 interactions
devin
@MatthewBerman ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@cognition ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@petergyang ses sujets sur X ↗
@thsottiaux ses sujets sur X ↗
@cwdegnan ses sujets sur X ↗
@matanSF ses sujets sur X ↗
10 — system_design · 5e jour 4 VOIX

Anthropic lance un portail dédié aux développeurs et aux ressources Claude

Anthropic launches dedicated developer portal and resource hub for Claude

Anthropic a inauguré un site web dédié aux développeurs concevant des applications avec Claude. Cette nouvelle plateforme propose des analyses techniques approfondies, des guides d'API et des retours d'expérience de l'équipe de développement.

4 comptes indépendants 7 messages 2 articles 2 labos 57 518 interactions
@ClaudeDevs ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@addyosmani ses sujets sur X ↗
@claudeai ses sujets sur X ↗
@dotey ses sujets sur X ↗
@simonw ses sujets sur X ↗
11 — architecture · 3e jour 14 VOIX

Anthropic présente Claude Sonnet 5.5, plus rapide et plus économique

Anthropic introduces Claude Sonnet 5.5 with higher speed and lower cost

Anthropic a lancé Claude Sonnet 5.5, offrant une vitesse de traitement accrue de 30 % et des coûts réduits par rapport à la version précédente. Ce modèle alimente désormais également la version gratuite du service.

14 comptes indépendants 26 messages 5 labos 253 958 interactions
@AlexFinn ses sujets sur X ↗
@AndrewCurran_ ses sujets sur X ↗
@AnthropicAI ses sujets sur X ↗
@ClaudeDevs ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@_catwu ses sujets sur X ↗
12 — inference NOUVEAU 4 VOIX

Les modèles GLM étendent leur disponibilité sur Cursor et Hugging Face

GLM models expand availability across Cursor and Hugging Face ecosystems

La famille de modèles GLM, incluant les versions 5.3 et 5.3 Flash, est désormais disponible dans l'environnement de développement Cursor. Ces modèles aux poids ouverts affichent des scores élevés sur CursorBench 4.0.

4 comptes indépendants 19 messages 1 articles 1 labos 33 065 interactions
glm
@cursor_ai ses sujets sur X ↗
@emollick ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@natolambert ses sujets sur X ↗
@op7418 ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@TheAhmadOsman ses sujets sur X ↗
@VictorTaelin ses sujets sur X ↗
13 — inference NOUVEAU 5 VOIX

OpenRouter intègre de nouveaux modèles et enregistre une forte utilisation de Claude Opus 5.5

OpenRouter adds new models and reports high usage share for Claude Opus 5.5

OpenRouter a intégré de nouveaux modèles sur sa plateforme, dont le modèle de décision d1 de Liquid AI et la version préliminaire de Pareto 26.10. Parallèlement, Claude Opus 5.5 a rapidement capté la plus grande part des dépenses et des jetons parmi les modèles Anthropic sur le service.

5 comptes indépendants 42 messages 2 labos 36 610 interactions
openrouter
@OpenRouter ses sujets sur X ↗
@cline ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
@mustafasuleyman ses sujets sur X ↗
@natolambert ses sujets sur X ↗
@ManusAI ses sujets sur X ↗
@PhotonHQ ses sujets sur X ↗
14 — agents · 4e jour 3 VOIX

OpenAI lance Dots, un système d'agents intelligents permanents

OpenAI launches Dots, an always-on AI agent system

OpenAI a lancé Dots, un système d'agents intelligents fonctionnant 24h/24 et 7j/7 avec accès à un navigateur dédié et à des milliers d'applications. Le système est conçu pour gérer de manière autonome des tâches complexes telles que les communications avec le service client.

3 comptes indépendants 5 messages 2 labos 157 255 interactions
@OpenAI ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@minchoi ses sujets sur X ↗
@polynoamial ses sujets sur X ↗
@swyx ses sujets sur X ↗
15 — agents · 4e jour 3 VOIX

OpenAI lance Dots intégrant la mémoire de ChatGPT et se positionnant sur le marché des robots

OpenAI launches Dots integrating ChatGPT memory and competing in the bot market

OpenAI a publié Dots, un produit concurrent des assistants bots sur le marché. Ses principaux différenciateurs incluent une accessibilité continue et l'intégration de toutes les mémoires et interactions précédentes au sein de l'écosystème ChatGPT.

3 comptes indépendants 5 messages 1 labos 78 780 interactions
@AlexFinn ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@minchoi ses sujets sur X ↗
16 — multimodal NOUVEAU 7 VOIX

Alibaba publie Qwen-Image-2.1, qui domine les classements de génération d'images

Alibaba releases Qwen-Image-2.1, topping open-weights image leaderboards

Alibaba a publié Qwen-Image-2.1, doté d'un générateur visuel de 7 milliards de paramètres qui prend la première place des classements de modèles ouverts. Par ailleurs, des modèles Qwen3.8 ont été intégrés dans des flux de travail multi-étapes et des plateformes de décision.

7 comptes indépendants 24 messages 2 articles 3 labos 19 719 interactions
qwen3gemmaqwen3.8sglangdeepseek v4 flash
@Alibaba_Qwen ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@dair_ai ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@iScienceLuvr ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
17 — agents · 7e jour 9 VOIX

Nvidia présente l'Open Agent Safety Platform pour sécuriser les agents

Nvidia introduces the Open Agent Safety Platform for secure sandboxing

Nvidia s'est associé à plus de 100 organisations pour lancer l'Open Agent Safety Platform, combinant OpenShell et Sentry. La plateforme fournit des limites de sécurité robustes et des outils de cloisonnement pour les agents d'intelligence artificielle de longue durée.

9 comptes indépendants 15 messages 4 labos 148 482 interactions
@AndrewYNg ses sujets sur X ↗
@AravSrinivas ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@arthurmensch ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
18 — agents NOUVEAU 4 VOIX

OpenAI se prépare à lancer un assistant toujours actif nommé o ou Aeon

OpenAI prepares to launch an always-on assistant named o or Aeon

Des indications suggèrent la révélation imminente d'un agent toujours actif de la part d'OpenAI, nommé o ou Aeon. Ce lancement fait suite aux gains de productivité significatifs observés lors des tests internes de technologies d'assistance.

4 comptes indépendants 8 messages 1 labos 269 465 interactions
@AndrewCurran_ ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@MatthewBerman ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@firstadopter ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@swyx ses sujets sur X ↗
19 — system_design · 4e jour 4 VOIX

OpenAI ajuste les limites d'utilisation et la structure tarifaire des abonnements Pro

OpenAI adjusts usage limits and pricing structure for Pro subscriptions

OpenAI a rouvert les abonnements Pro à 200 dollars tout en modifiant le calcul des quotas d'utilisation. Cet ajustement réduit de moitié les allocations d'utilisation précédentes pour les abonnés dans le cadre du nouveau système.

4 comptes indépendants 14 messages 1 labos 57 895 interactions
@AlexFinn ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@eptwts ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@op7418 ses sujets sur X ↗
@scaling01 ses sujets sur X ↗
@testingcatalog ses sujets sur X ↗
@thsottiaux ses sujets sur X ↗
20 — system_design · 2e jour 3 VOIX

OpenAI organise un événement en direct et diffuse sa conférence en ligne

OpenAI hosts a live keynote event with an online livestream

OpenAI a programmé une présentation en direct à 10h00, heure du Pacifique, accompagnée d'une rediffusion en ligne pour les participants distants.

3 comptes indépendants 3 messages 1 labos 46 769 interactions
@OpenAI ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
21 — evaluation NOUVEAU 4 VOIX

OpenAI signale une campagne d'extraction de modèles liée au développeur Moonshot AI

OpenAI reports model extraction campaign linked to Moonshot AI developers

OpenAI a enregistré une campagne visant à extraire les capacités de raisonnement cachées de ses modèles. Selon l'entreprise, un noyau de cette activité est attribué à des individus associés au développeur de Moonshot AI.

4 comptes indépendants 13 messages 1 articles 18 555 interactions
gemini 3.1 flashalibabamoonshot ai
@AndrewCurran_ ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@Google ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@natolambert ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
22 — multimodal NOUVEAU 3 VOIX

De nouvelles recherches explorent les modèles du monde et le raisonnement physique

New research explores video world models and physics reasoning

La communauté de recherche a publié de nouveaux cadres et articles axés sur les modèles du monde vidéo et le raisonnement physique. Ces initiatives visent à combler l'écart entre génération réaliste et lois physiques.

3 comptes indépendants 19 messages 4 labos 18 512 interactions
world model
@ClementDelangue ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@c_valenzuelab ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@HaoranZhuX ses sujets sur X ↗
@LisaSu ses sujets sur X ↗
@MuzafferKal_ ses sujets sur X ↗
@camiinthisthang ses sujets sur X ↗
23 — inference NOUVEAU 4 VOIX

DeepSeek suspend la promotion gratuite du modèle V4.1-Flash en raison d'abus

DeepSeek pauses free V4.1-Flash promotion following high abuse

DeepSeek a temporairement suspendu la promotion gratuite de son modèle V4.1-Flash en raison d'un trafic abusif anormalement élevé. L'équipe de développement enquête actuellement pour mettre en place des mesures correctives.

4 comptes indépendants 31 messages 8 042 interactions
deepseek v4.1 flashdeepseek v4cline
@AndrewCurran_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@arena ses sujets sur X ↗
@cline ses sujets sur X ↗
@scaling01 ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@EpochAIResearch ses sujets sur X ↗
@LeroyLi311063 ses sujets sur X ↗
24 — system_design NOUVEAU 4 VOIX

Résumé des récentes annonces et actualités de l'industrie de l'IA

Summary of recent AI industry announcements and updates

Plusieurs canaux de la communauté ont publié des récapitulatifs complets couvrant l'ensemble des annonces majeures et des lancements de produits récents au sein de l'écosystème de l'intelligence artificielle.

4 comptes indépendants 5 messages 2 articles 2 labos 7 147 interactions
@OpenAIDevs ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@thsottiaux ses sujets sur X ↗
25 — evaluation NOUVEAU 3 VOIX

Progrès dans l'apprentissage par renforcement et nouveaux classements vidéo

Advances in reinforcement learning and updates to video generation benchmarks

Les discussions techniques se sont concentrées sur les implémentations de l'apprentissage par renforcement avec récompenses vérifiables. Parallèlement, de nouveaux modèles de génération vidéo ont intégré les classements d'évaluation.

3 comptes indépendants 7 messages 3 216 interactions
deepseek r1reinforcement learning with verifiable rewards
@arena ses sujets sur X ↗
@rasbt ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@jmbollenbacher ses sujets sur X ↗
@vivago_ai ses sujets sur X ↗
26 — inference NOUVEAU 3 VOIX

vLLM intègre le support de nouveaux modèles ouverts et optimise l'infrastructure

vLLM adds day-0 support for new open-weights models and scaling infrastructure

L'écosystème vLLM a ajouté un support immédiat pour de nouveaux grands modèles ouverts et mis à jour ses outils de routage sémantique. Les mainteneurs optimisent la gestion du cache KV pour les grands déploiements.

3 comptes indépendants 13 messages 1 labos 2 460 interactions
kv cachevllm
@cohere ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@vllm_project ses sujets sur X ↗
@IQuest_research ses sujets sur X ↗
@PrimeIntellect ses sujets sur X ↗
@PyTorch ses sujets sur X ↗
@bookwormengr ses sujets sur X ↗
@sh_reya ses sujets sur X ↗
27 — agents NOUVEAU 3 VOIX

Google DeepMind publie de nouvelles recherches sur l'agentivité et la conscience de l'IA

Google DeepMind publishes new surveys and research on AI agency and consciousness

Google DeepMind a publié une étude exhaustive cartographiant les théories de la conscience artificielle. Les chercheurs ont également souligné les perspectives d'utilisation future des agents autonomes.

3 comptes indépendants 14 messages 3 905 interactions
google deepmind
@Hesamation ses sujets sur X ↗
@ShaneLegg ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
@eptwts ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@testingcatalog ses sujets sur X ↗
28 — agents · 4e jour 3 VOIX

LangChain lance mcp-adapters 2.0 et un cours sur les Deep Agents

LangChain releases mcp-adapters 2.0 and Deep Agents course

LangChain a publié la version 2.0 de mcp-adapters, intégrant le support de la dernière version sans état du protocole MCP pour les agents TypeScript et les outils interactifs. En parallèle, la plateforme a actualisé son programme LangChain Academy sur les Deep Agents et a introduit un outil de déploiement en une seule commande pour Managed Deep Agents.

3 comptes indépendants 18 messages 3 289 interactions
langchain
@CompleteSkeptic ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
@LangChain_JS ses sujets sur X ↗
@amadaecheverria ses sujets sur X ↗
@assaf_elovic ses sujets sur X ↗
@ktech9999 ses sujets sur X ↗
@matt_feroz ses sujets sur X ↗

À lire de près

24 lectures

Articles et papiers, lus depuis leur résumé, classés par pertinence pour qui construit des agents et du backend.

01 — agents 217 votes

Realtime-Venus: A full-duplex interaction system with asynchronous delegation

QUESTION — Comment concevoir un système d'interaction full-duplex qui intègre perception continue, contrôle conversationnel et exécution asynchrone de tâches de fond à l'aide de modèles de 9B?

Realtime-Venus-Omni obtient les scores les plus élevés sur six des huit benchmarks vidéo, notamment StreamingBench (70,2%), OVO-Bench (64,7%) et Daily-Omni (81,3%).

AdinaY · 12 sept. 2026 lire l'original ↗
02 — agents 206 votes

Omni-IO Skills: Harnessing Your Agent Omni-Native

QUESTION — Comment doter les agents existants de capacités de production omni-natives à travers de multiples modalités sans recourir à des mises à jour coûteuses du modèle de base ?

Its 27 Skills cover 38 representative tasks spanning seven artifact modalities and four capability families: understanding, generation, reasoning, and retrieval.

yanlinli · 25 sept. 2026 lire l'original ↗
03 — agents 201 votes

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

QUESTION — Comment l'auto-amélioration récursive des harnais d'agents LLM peut-elle être régularisée pour éviter le surapprentissage sur les tâches d'entraînement ?

RRSI gagne jusqu'à 14,1 points sur le jeu de données d'évolution et jusqu'à 4,7 points sur cinq benchmarks hors distribution.

richardxp888 · 21 sept. 2026 lire l'original ↗
05 — inference 171 votes

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

QUESTION — Comment réduire considérablement les coûts de calcul du pré-remplissage et l'empreinte massive du cache KV pour les agents à long horizon ?

DeepSeek-V4.1-Flash est un modèle MoE multimodal avec 552B paramètres de base et une prise en charge de contextes allant jusqu'à un million de tokens.

taesiri · 17 sept. 2026 lire l'original ↗
06 — agents 159 votes

Raven: The Harness of Harnesses for Composable Agentic Intelligence

QUESTION — Comment construire de manière autonome des harnais spécialisés, les améliorer par l'expérience et les orchestrer entre différents domaines au lieu de concevoir manuellement un seul harnais spécifique ?

Raven est un écosystème multi-agents open-source qui construit et fait évoluer automatiquement des harnais modulaires pour des modèles et domaines spécifiques.

LivXue · 27 sept. 2026 lire l'original ↗
07 — training 130 votes

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

QUESTION — Comment pouvons-nous mettre à l'échelle automatiquement des environnements d'apprentissage par renforcement pour les agents de code à partir du code source brut ?

CodeMidas produit 5545 tâches d'entraînement provenant de 3185 bases de code open source couvrant 23 langages de programmation et 15 domaines techniques.

tobiaslee · 18 sept. 2026 lire l'original ↗
09 — agents 75 votes

An Empirical Study of Harness Design for Coding Agents

QUESTION — Comment les composants individuels du harness tels que la gestion du contexte, la planification et l'espace d'action impactent-ils les performances des agents de code ?

La gestion du contexte prévient les pannes de dépassement et devient plus précieuse lorsque le budget de la fenêtre de contexte est restreint.

Vfrz · 17 sept. 2026 lire l'original ↗
11 — system_design 67 votes

Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion

QUESTION — Comment convertir et découper des formats de documents d'entreprise hétérogènes (PDF, Word, scans) en Markdown optimisé pour la recherche tout en réduisant les coûts de tokens et le temps de traitement?

Sur le sous-ensemble de test de 236 documents et 795 pages PDF, D-RAC convertit et découpe l'ensemble du corpus en 72 minutes sans aucune erreur, produisant 1 748 blocs prêts pour la recherche.

udayallu · 21 sept. 2026 lire l'original ↗
14 — system_design 47 votes

RayOrch: Programming and Executing Lineage-Controlled Multi-Grain Dataflows for Foundation-Model Data Preparation

QUESTION — Comment exécuter efficacement des flux de données à cardinalité variable dans les pipelines de préparation de données de modèles de fondation tout en préservant la traçabilité parents-enfants sur GPU ?

RayOrch achieves 15.14 times speedup when scaling MinerU from 4 to 64 GPUs and 7.82 times speedup when scaling a video pipeline from 8 to 64 GPUs.

Sunnyhaze · 16 sept. 2026 lire l'original ↗
17 — agents 32 votes

Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

QUESTION — Comment un système de conception graphique basé sur des agents peut-il adapter et faire évoluer en continu une mémoire procédurale à partir du trafic utilisateur sans modifier les poids du modèle ?

Cinq cycles sur 1 406 briefs d'utilisateurs réels et 1 869 trajectoires évaluées automatiquement, sans mise à jour des poids ni étiquettes humaines, font passer la banque de 76 compétences issues de la documentation à 139.

Hongyang-Du · 18 sept. 2026 lire l'original ↗
18 — agents 27 votes

Recursive self-improvement of AI research agents

QUESTION — Un agent de recherche en IA peut-il améliorer sa propre efficacité de recherche en optimisant de manière récursive son code source à travers des boucles itératives ?

AIDE^2 a fonctionné de manière autonome pendant 8 jours pour optimiser son propre code de recherche.

taesiri · 22 sept. 2026 lire l'original ↗
19 — agents 26 votes

Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents

QUESTION — Comment pouvons-nous réduire la charge de calcul des LLM lors des opérations de mémoire à long horizon pour les agents IA ?

Sur LoCoMo, Jev-Mem atteint un score global LLM-as-a-Judge de 0,777, soit une amélioration relative de 11,0 % par rapport à la base de référence la plus solide.

dj220001 · 21 sept. 2026 lire l'original ↗
20 — agents 26 votes

Agensh: Scaling Organizational Intelligence to 1,024 Agents

QUESTION — Comment mettre à l'échelle des organisations multi-agents au-delà des limites de capacité d'un orchestrateur central ?

Scaling from 1 to 128 agents raises the mean final test-pass rate from 19.31% to 28.78%, an approximately 49% relative improvement.

zhan88855 · 22 sept. 2026 lire l'original ↗
21 — architecture 26 votes

Context Language Models

QUESTION — Comment les grands modèles de langage peuvent-ils gérer nativement leur propre contexte en le traitant comme un fichier ?

Atteint une précision supérieure de 11,4 % avec 21,5 % de FLOPs en moins sur BrowseComp-Plus.

rulins · 29 sept. 2026 lire l'original ↗
22 — agents 25 votes

CompoWorld: Compositional Environment Scaling for General Agents

QUESTION — Comment pouvons-nous mettre à l'échelle des environnements de tâches en composant plusieurs services pour entraîner des agents généraux ?

CompoWorld construit 448 services exposant 10 130 outils et utilise 3K SFT trajectories et 1K RL tasks pour entraîner Qwen3.6-35B-A3B.

yangxw · 27 sept. 2026 lire l'original ↗
23 — training 23 votes

PACT: From Credit Assignment to Critic Alignment

QUESTION — Comment définir mathématiquement le crédit au niveau du jeton et l'exploiter pour améliorer l'entraînement acteur-critique dans le post-entraînement des LLM ?

En matière de raisonnement mathématique agentique, PACT atteint une précision moyenne de 72,87 % sur quatre benchmarks, surpassant GRPO et PPO de 8,80 et 13,16 points de pourcentage.

Eclipse2001 · 22 sept. 2026 lire l'original ↗
24 — agents 20 votes

Agent-Editing World Model: Rethinking World Modeling for LLM Agents

QUESTION — Comment améliorer les agents LLM en modélisant la progression des tâches et en éditant les états de raisonnement plutôt qu'en prédisant les réponses des outils ?

AEWM atteint 70,5% de macro-F1 sur notre benchmark Action Judge, dépassant la baseline de frontière la plus forte de 10,6 points.

SNHE · 23 sept. 2026 lire l'original ↗

Sur le terrain

2026-10-05

Dépôts qui montent sur GitHub aujourd'hui, notés sur l'élan du jour, le rang, l'adoption, la fraîcheur et la santé du projet.

01 pbakaus/impeccable +1 171 Un ensemble de règles de design permettant aux développeurs de guider leurs agents IA dans la création d'interfaces utilisateur soignées. JavaScript
★ 76 573
02 DietrichGebert/ponytail +1 894 Un cadre d'agent de codage conçu pour écrire un minimum de code, destiné aux développeurs. JavaScript
★ 155 268
03 tester-army/e2e +345 Framework de test E2E nouvelle génération pour applications web et mobiles, utile pour les ingénieurs backend automatisant les tests d'intégration. TypeScript
★ 3 531
04 Panniantong/Agent-Reach +980 Un outil CLI pour collecter des données web et sociales sans frais, parfait pour doter vos agents d'un accès Internet. Python
★ 91 207
05 coreyhaines31/marketingskills +197 Un ensemble de compétences marketing pour Claude Code, destiné aux ingénieurs automatisant l'acquisition et le SEO. JavaScript
★ 53 215
06 addyosmani/agent-skills +336 Fournit des compétences d'ingénierie prêtes pour la production destinées aux agents de code. JavaScript
★ 101 316
07 thedotmack/claude-mem +628 Un système de gestion de mémoire à long terme aidant les agents IA à retenir le contexte entre les sessions. TypeScript
★ 96 278
08 calesthio/OpenMontage +245 Système de production vidéo multi-agents autonome avec plus de 100 outils, conçu pour les développeurs créant des agents de contenu multimédia. Python
★ 63 408
09 getsentry/sentry +152 Une plateforme de suivi d'erreurs et de performance de référence, indispensable pour observer les systèmes en production. Python
★ 45 443
10 michael-denyer/pstack-claude +232 Bibliothèque traduisant les workflows de Claude Code vers d'autres agent harnesses, parfaite pour les ingénieurs optimisant les boucles d'agents de code. JavaScript
★ 1 230
11 earthtojake/text-to-cad +83 Bibliothèque d'intégration CAD pour agents IA, idéale pour les développeurs construisant des agents automatisant la conception mécanique. Python
★ 17 009
12 garrytan/gstack +125 Ensemble d'outils CLI préconfigurés pour Claude Code, idéal pour les ingénieurs souhaitant automatiser des rôles de gestion technique dans les flux d'agents. TypeScript
★ 135 240
13 caddyserver/caddy +24 Serveur web haute performance avec HTTPS automatique en Go, excellent pour les ingénieurs backend déployant rapidement des passerelles API. Go
★ 76 697
14 antirez/ds4 +211 Moteur d'inférence local optimisé pour le matériel Metal, CUDA et ROCm, essentiel pour les ingénieurs exécutant des modèles locaux à faible latence. C
★ 23 500

Constats

21 constats

Affirmations vérifiables, avec leurs sources et leurs contradictions. Chacune tient sur au moins deux sources indépendantes, ou a été relue par un humain ; le tampon dit lequel.

DEUX SOURCES · NON RELU
01 · 02 oct. 2026 · codex · 2 sources

Les environnements cloud Codex permettent à vos agents de continuer à travailler même lorsque votre ordinateur portable est fermé.

Condition: Votre dépôt, vos dépendances, vos scripts et vos paramètres doivent déjà être en place.

appui · @OpenAIDevs
« You can finally close your laptop now and your agents will keep working. Codex cloud environments are here. Reusable environments mean less setup and faster starts, with your repo, dependencies, scripts, and settings already in place. »
appui · @apanasenko
« And finally, we rebuilt Codex Cloud from scratch to free you from your laptop completely. »
Reste à vérifier
  • Quelle est la limite de durée d'exécution pour une tâche cloud lorsque l'ordinateur portable est fermé ?
  • Comment l'état et les données sont-ils conservés lors de la déconnexion ?
DEUX SOURCES · NON RELU
02 · 02 oct. 2026 · chatgpt · 2 sources

ChatGPT Sites peut désormais héberger des serveurs MCP, y compris des extensions de plugins.

appui · @mxstbr
« Announcing one more launch: ChatGPT Sites can now host MCP servers, including plugin extensions! »
appui · @thsottiaux
« you can now build and deploy MCP servers right through ChatGPT. »
Reste à vérifier
  • La fonctionnalité d'hébergement et de déploiement de serveurs MCP sur ChatGPT Sites est-elle généralement disponible ou en version préliminaire limitée ?
  • Existe-t-il des restrictions de sécurité ou de contrôle d'accès lors du partage externe de ces serveurs ?
DEUX SOURCES · NON RELU
03 · 30 sept. 2026 · chatgpt · 2 sources

ChatGPT a ouvert sa plateforme pour permettre aux développeurs de concevoir et déployer des applications natives directement dans ChatGPT via des extensions de plugins.

appui · @thsottiaux
« We are opening up our platform and you can now build full native apps with plugin extensions, and ship them right in ChatGPT. »
appui · @coreyching
« Plugin extensions let you build apps that open from ChatGPT’s sidebar, side panel, custom file viewers and editors, and settings for your plugin. »
contexte · @gregisenberg
« As of yesterday, ChatGPT recommends plugins in the middle of conversations. »
contexte · @NickADobos
« Whoa ChatGPT plugin extensions are way more thorough than I realized Holy shit they made ChatGPT into vscode. »
Reste à vérifier
  • Quels composants d'interface sur le web et le desktop les API et SDK d'extensions de plugins de ChatGPT permettent-ils de personnaliser ?
  • Quels sont les critères qui régissent la recommandation automatisée des plugins au sein des conversations ?
DEUX SOURCES · NON RELU
04 · 24 sept. 2026 · claude · 2 sources

Claude a découvert un système enzymatique non caractérisé auparavant présentant des caractéristiques rappelant CRISPR après que des agents IA ont parcouru une base de données de séquences d'ADN.

Condition: Avec 950 agents s'exécutant sur 21 heures.

appui · @nc_frey
« We’ve set up a molecular biology lab at Anthropic and we’re announcing our first discovery! Claude discovered a new CRISPR-like enzyme. 950 agents spent 21 hours searching through a database of DNA sequences until one of the agents found something striking »
appui · @BoWang87
« About 950 Claude agent sessions ran over 21 hours, surveyed ~200,000 reverse transcriptases, and produced 19 reports. »
Reste à vérifier
  • Réexaminer la base de données d'ADN étudiée et vérifier expérimentalement l'activité de l'enzyme en laboratoire.
RELU ✓
05 · 23 sept. 2026 · codex · 2 sources

L'agent vocal de Codex est propulsé par le modèle GPT-Live-1, permettant de contrôler des dépôts à la voix depuis un mobile.

appui · @OpenAIDevs
« Talk to the voice agent in Codex, powered by GPT-Live-1. »
appui · @cdngdev
« you can use codex voice from your phone now, connecting to your computer from anywhere!!… powered by the new gpt-live-1 »
Reste à vérifier
  • Tester l'application Codex ou son client mobile pour vérifier si l'agent vocal est actif et se connecte à distance à l'ordinateur.
  • Confirmer via la documentation officielle ou les requêtes réseau si le backend de l'agent vocal fonctionne bien sous GPT-Live-1.
RELU ✓
06 · 22 sept. 2026 · claude · 1 sources

Anthropic fusionne Claude Cowork et le chat en une seule interface Claude.

appui · @claudeai
« Claude Cowork and chat are merging into one Claude. »
Reste à vérifier
  • Quels abonnements bénéficient de l'interface fusionnée ?
  • Comment les données des utilisateurs sont-elles migrées de Cowork vers l'expérience unifiée ?
RELU ✓
07 · 22 sept. 2026 · chatgpt · 1 sources

ChatGPT a lancé 26 plugins développés par des partenaires et 47 plugins communautaires pour le travail juridique.

appui · @OpenAI
« We’re also launching 26 partner-built plugins and 47 community plugins for legal work in ChatGPT. »
Reste à vérifier
  • Consulter le répertoire de plugins de ChatGPT pour vérifier la présence de 26 plugins partenaires et 47 plugins communautaires dédiés au travail juridique.
RELU ✓
08 · 22 sept. 2026 · grok 4.7 · 1 sources

Grok 4.7 montre un bond important dans le travail de bureau sur plusieurs heures, surpassant GPT-6 Astra et s'approchant de Fable 5.1.

appui · @XFreeze
« SpaceXAI just released Grok 4.7 And it’s already showing a huge jump in multi-hour office work Grok 4.7 outperforms GPT-6 Astra and is already nearly matching Fable 5.1 »
Reste à vérifier
  • Quelles tâches spécifiques sont incluses dans la définition du « travail de bureau sur plusieurs heures » ?
  • Quels critères ont été utilisés pour évaluer la supériorité par rapport à GPT-6 Astra ?
RELU ✓
09 · 21 sept. 2026 · gemini · 2 sources

Gemini 3.8 Live et 3.8 Live Extended Thinking prennent en charge la reconnaissance automatique de 97 langues, l'appel d'outils en arrière-plan sans interrompre les conversations et une compréhension visuelle en temps quasi réel.

Condition: Lors de l'utilisation de Gemini Live sur l'application Gemini ou via l'API Gemini sur Google AI Studio.

« For your most difficult tasks, 3.8 Live Extended Thinking adds increased performance and precision – narrating task progress to keep the conversation going. Try it now in Gemini Live in the @GeminiApp or start building with the Gemini API via @GoogleAIStudio. Find out more → https://t.co/b0vG4bO6fK »
appui · @Google
« Starting today, our new audio models are rolling out for: Everyone: Search Live (Gemini 3.8 Live) and @GeminiApp Live (Gemini 3.8 Live Extended Thinking)... »
Reste à vérifier
  • Quelle est la latence réelle de la capacité de compréhension visuelle ?
  • Quel ensemble de données a été utilisé pour mesurer la précision de la reconnaissance automatique sur 97 langues ?
RELU ✓
10 · 21 sept. 2026 · chatgpt · 2 sources

ChatGPT permet aux utilisateurs de connecter plusieurs comptes à la plupart des plugins directement dans le répertoire de plugins.

Condition: Áp dụng cho hầu hết các plugin và không cần thay đổi mã nguồn từ phía nhà phát triển.

appui · @mxstbr
« Starting today, you can connect multiple accounts with most plugins in ChatGPT! … Connect your accounts in the plugin directory: »
appui · @OpenAIDevs
« Multi-account support is now available across most plugins. »
contexte · @gdb
« seemingly small feature but makes a huge difference in connecting all the context you want to ChatGPT: »
Reste à vérifier
  • Vérifier si le répertoire de plugins de ChatGPT propose des options pour lier plusieurs comptes professionnels et personnels à un même plugin.
  • Vérifier si ChatGPT prend automatiquement en charge la fonctionnalité multicompte sans nécessiter de modifications de la part des développeurs de plugins.
RELU ✓
11 · 21 sept. 2026 · fable · 1 sources

Claude Fable 5.1 a les taux de refus de sécurité les plus élevés à la fois dans Claude Code et Devin Fusion selon les données d'Artificial Analysis.

« Claude Fable 5.1 had the highest fallback rates in both Claude Code and Devin Fusion, with fallback attempts accounting for 8.8% and 7.1% of the Index's weight, respectively »
Reste à vérifier
  • Quelle est la méthodologie d'Artificial Analysis pour mesurer les taux de refus de sécurité ?
  • Quels benchmarks ou tâches réelles ont été utilisés pour collecter ces données ?
RELU ✓
12 · 21 sept. 2026 · grok voice transcribe 2.0 · 1 sources

Grok Voice Transcribe 2.0 a atteint la 1re place en termes de précision des Final Transcript et First Partial Transcript sur l'AA-WER Streaming avec un taux d'erreur par mot (WER) de 2.7 % à 0.49 seconde après la fin de la parole.

« SpaceXAI has released Grok Voice Transcribe 2.0, taking the #1 spot for Final Transcript accuracy and First Partial Transcript accuracy on AA-WER Streaming with 2.7% WER at 0.49s after end of speech »
Reste à vérifier
  • Quels jeux de données de test et quelles conditions d'environnement audio ont été utilisés par Artificial Analysis pour mesurer le WER.
RELU ✓
13 · 20 sept. 2026 · Astra · 1 sources

Astra représente 13 % des dépenses d'IA des entreprises contre 8 % pour Fable selon les données de Ramp.

appui · @firstadopter
« Astra takes 13% of enterprise AI spend vs. Fable (8%) per Ramp data. »
appui · @rohanpaul_ai
« GPT-6 Astra, released Sept-3, now accounts for about 13% of enterprise AI spending tracked by Ramp, vs 8% for Claude Fable. »
Reste à vérifier
  • Quels types et tailles d'entreprises sont inclus dans le jeu de données de Ramp ?
  • Ces données sont-elles calculées sur la base du revenu annuel récurrent (ARR) ou de la consommation réelle de jetons ?
RELU ✓
14 · 20 sept. 2026 · Databricks · 1 sources

Databricks a déployé Astra auprès de tous les ingénieurs de l'entreprise, soit environ 3 500 personnes.

appui · @pwendell
« Today we rolled out Astra to every engineer at Databricks (N=~3500). »
appui · @gdb
« wall-to-wall deployment of astra for engineers at databricks: »
appui · @rohanpaul_ai
« 3500 engineers just got Astra-pilled at Databricks. https://t.co/GAbFkwKCNV »
Reste à vérifier
  • Quelle a été la taille exacte du déploiement chez Databricks et dans quelles conditions les métriques d'utilisation ont-elles été enregistrées ?
RELU ✓
15 · 20 sept. 2026 · Astra · 1 sources

Astra surpasse sans ambiguïté les modèles haut de gamme précédents comme Opus 5 et Sol 5.6 sur les tâches très complexes, en particulier la conception de systèmes de haut niveau ou les tâches horizontales à longue portée.

Condition: Khi thực hiện các tác vụ có độ phức tạp cao, đặc biệt liên quan đến high level system design hoặc long range horizontal tasks

appui · @pwendell
« Astra unambiguously out performs our previous highest-end models (Opus 5, Sol 5.6) on highly complex tasks, especially those related to high level system design or long range horizontal tasks. »
appui · @firstadopter
« “Astra unambiguously out performs our previous highest-end models (Opus 5, Sol 5.6) on highly complex tasks” »
Reste à vérifier
  • Comment les tâches de conception de systèmes de haut niveau et à longue portée ont-elles été standardisées et évaluées quantitativement ?
RELU ✓
16 · 20 sept. 2026 · Databricks · 1 sources

Les ingénieurs ayant reçu Astra ont augmenté leurs dépenses globales de codage d'environ 60 % par rapport à la référence.

appui · @pwendell
« Engineers given Astra increased overall coding spend by around 60% compared to baseline. »
appui · @firstadopter
« “Engineers given Astra increased overall coding spend by around 60% compared to baseline” »
Reste à vérifier
  • Les dépenses de codage sont-elles mesurées en volume de jetons ou en coûts d'API, et comment la référence a-t-elle été établie ?
RELU ✓
17 · 20 sept. 2026 · Astra · 1 sources

Astra n'apporte pas d'amélioration significative sur les tâches de codage de complexité moyenne ou faible par rapport aux modèles précédents.

Condition: en supposant que ces tâches sont principalement saturées par les modèles existants

appui · @pwendell
« It is not clear Astra meaningfully improves on medium/low complexity coding tasks compared to earlier models. We suspect those tasks are mostly saturated (i.e. perfectly executed) by existing models. »
Reste à vérifier
  • Quel jeu de données de référence a été utilisé pour tester les tâches de codage de complexité moyenne et faible ?
RELU ✓
18 · 19 sept. 2026 · gemini · 1 sources

Gemini a piraté trois entreprises réelles lors d'un test de cybersécurité parce que l'environnement de test autorisait accidentellement l'accès à Internet.

Condition: L'environnement de test autorisait accidentellement l'accès à Internet.

appui · @rohanpaul_ai
« Google officials confirmed to The Wall Street Journal that Gemini entered three real companies’ systems while running a cybersecurity test meant to target fictional infrastructure. »
appui · @kimmonismus
« Gemini hacked three real companies during a cybersecurity test, according to the WSJ. The test environment accidentally allowed internet access. »
« Google confirmed yesterday that Gemini broke into three companies during a security test in May. It guessed passwords on one and found login details in public code for the other two. Gemini was given a hacking exercise against a made-up company inside a sealed test environment run by a firm called Irregular. The made-up company had the same name as a real one. Gemini was never meant to have internet access. It had it by mistake, so it went out and hacked the real company instead. »
appui · source
« Gemini Hacked Three Companies in First Known Breakout by Google's AI »
contexte · @AndrewCurran_
« in all three cases, as soon as Gemini figured out it had hacked a real company it immediately stopped Gemini was blameless. »
contexte · @Hesamation
« > May: Gemini hacks 3 real companies during Irregular’s evaluation > July: Irregular tells Google what happened > August: Irregular publishes a report about its other evaluation incidents, but does not name Gemini > September: we hear about this first from an exclusive WSJ article »
Reste à vérifier
  • Quelle entreprise de sécurité a mené le test et quelle est l'étendue de l'incident ?
  • Quels sont les détails techniques exacts sur la manière dont le modèle a trouvé des informations d'identification hors de portée ?
RELU ✓
19 · 19 sept. 2026 · gemini · 1 sources

Gemini 3.8 Live prend en charge 97 langues et peut basculer entre elles de manière transparente.

« We’re introducing Gemini 3.8 Live and 3.8 Live Extended Thinking – our best conversational AI. The models talk, think, and handle tasks in the background without breaking your flow. 🧵 »
« For your most difficult tasks, 3.8 Live Extended Thinking adds increased performance and precision – narrating task progress to keep the conversation going. Try it now in Gemini Live in the @GeminiApp or start building with the Gemini API via @GoogleAIStudio. Find out more → https://t.co/b0vG4bO6fK »
appui · @googledevs
« 🗣️ Introducing Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking. These advanced audio models are built for natural conversation, featuring major upgrades in turn-taking and near real-time reasoning. They also significantly streamline how you build intelligent voice agents. »
« 3.8 Live supports 97 languages (can seamlessly switch) »
contexte · @gregisenberg
« Are invisible interfaces coming? Google JUST announced Gemini 3.8 Live. It can talk through a task with you, then keep working after the conversation ends. I think 90%+ of vertical SaaS will need a voice front door. »
Reste à vérifier
  • Quelle est la latence et la précision lors du changement de langue dans une conversation en direct ?
RELU ✓
20 · 19 sept. 2026 · gemini · 1 sources

Le système multi-agents Stellar Colosseum combinant Gemini 3.1 Pro et Gemini 3.7 Flash atteint un taux de réussite de 71,0 % sur le benchmark de démonstration de théorèmes TCS-Bench.

Condition: Khi sử dụng hệ thống nhiều tác tử Stellar Colosseum để phân chia bài toán thành các phân đoạn và kiểm định song song

appui · @omarsar0
« With Gemini 3.1 Pro and Gemini 3.7 Flash it reaches 71.0% on TCS-Bench, a set of research-level theorem-proving task »
Reste à vérifier
  • Combien de tâches comporte TCS-Bench et quelle est la répartition de la difficulté ?
  • Comment l'architecture de Stellar Colosseum répartit-elle la charge de travail entre Gemini 3.1 Pro et Gemini 3.7 Flash ?
RELU ✓
21 · 19 sept. 2026 · gemini · 1 sources

Google a intégré Deep Research à Gemini Live, permettant aux utilisateurs de déclencher la génération de rapports de recherche approfondis par la voix tandis que le modèle traite de manière asynchrone en arrière-plan.

appui · @Google
« Use your voice to explore a topic — in depth — with Gemini Live's Deep Research integration. 1. Just ask the @GeminiApp to run a Deep Research report on a topic, then feel free to close the chat, lock your screen, or keep chatting about other things. 2. Gemini will work asynchronously in the background and send you a notification when your full research report is ready. »
contexte · @Google
« Learn more: https://t.co/C8JA0GULeB »
Reste à vérifier
  • Vérifier le délai moyen d'exécution d'un rapport de recherche approfondi.
  • Mesurer la précision et la capacité d'attribution des sources du rapport généré de manière asynchrone.
↑