CONSONANCE.for your information
lundi 5 octobre 2026frenvi
FICHE N° 2026-10-01RADAR IA & AGENTS

Trois voix, et ça devient une nouvelle.

Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.

Synthèse du jourécrite par le modèle
  1. 01 Intégration de ChatGPT dans DevinLa plateforme Devin permet aux utilisateurs de se connecter via un abonnement ChatGPT, s'ajoutant à l'expansion de la plateforme de plugins de ChatGPT.→ 0103
  2. 02 OpenAI prépare le lancement d'agents autonomesOpenAI se prépare à présenter des agents continus lors du DevDay, un événement présentant également de nouveaux lancements de produits.→ 1219
  3. 03 Anthropic lance la gamme Claude Sonnet 5.5Anthropic a publié Claude Sonnet 5.5 offrant une exécution plus rapide et des coûts réduits, tout en préparant Claude Haiku 5.5.→ 04

Vidéo du jour

bobine n° 5 · 1:04
ÉTIQUETTEarchitecture · 21 voix

OpenAI déploie GPT-6.1 et corrige des bugs visuels sur la gamme GPT-6

OpenAI a déployé GPT-6.1 pour les abonnés et via son API, tout en corrigeant un bogue affectant la compréhension visuelle des modèles GPT-6 Sol et GPT-6 Luna.

GÉNÉRÉE AUTOMATIQUEMENT
Transcription

Consonance, bobine n° 5.

Jeudi 1 octobre : ce que plusieurs voix indépendantes disent en même temps.

OpenAI déploie GPT-6.1 et corrige des bugs visuels sur la gamme GPT-6.

OpenAI a déployé GPT-6.1 pour les abonnés et via son API, tout en corrigeant un bogue affectant la compréhension visuelle des modèles GPT-6 Sol et GPT-6 Luna.

ChatGPT élargit sa plateforme de plugins et introduit des outils de collaboration.

ChatGPT permet désormais de concevoir des applications natives via des extensions de plugins directement intégrées aux conversations.

Anthropic lance Claude Sonnet 5.5 et met à jour les limites de Claude Code.

Anthropic a publié Claude Sonnet 5.5 avec des guides de migration et de développement.

Google lance le modèle Gemini 4 Argon et la gamme audio Gemini 3.8 Flash TTS.

Google a introduit Gemini 4 Argon, un modèle de pointe conçu pour les flux de travail complexes en génie logiciel et en cybersécurité, doté d'une limite de sortie d'un million de tokens.

28 sujets aujourd'hui, trois voix indépendantes au minimum pour chacun.

Les sources sont sur consonance.fyi.

En discussion

28 · sujets

Sujets repris par au moins trois comptes indépendants sur les sept derniers jours.

01 — agents · 2e jour 17 VOIX

ChatGPT élargit sa plateforme de plugins et introduit des outils de collaboration

ChatGPT expands its plugin platform and team collaboration features

ChatGPT permet désormais de concevoir des applications natives via des extensions de plugins directement intégrées aux conversations. La plateforme déploie également un espace collaboratif dédié aux notes partagées et aux visualisations en temps réel.

17 comptes indépendants 99 messages 4 labos 150 349 interactions
chatgptagents api
@AndrewBolis ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@MatthewBerman ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@SchmidhuberAI ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
02 — architecture · 6e jour 14 VOIX

Google lance le modèle Gemini 4 Argon et la gamme audio Gemini 3.8 Flash TTS

Google launches Gemini 4 Argon and Gemini 3.8 Flash TTS audio models

Google a introduit Gemini 4 Argon, un modèle de pointe conçu pour les flux de travail complexes en génie logiciel et en cybersécurité, doté d'une limite de sortie d'un million de tokens. L'entreprise a également publié deux nouveaux modèles audio, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS.

14 comptes indépendants 73 messages 2 articles 3 labos 308 843 interactions
geminigemini 3.8
@AndrewCurran_ ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@GeminiApp ses sujets sur X ↗
@Google ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OfficialLoganK ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@arena ses sujets sur X ↗
03 — agents · 2e jour 5 VOIX

Cognition franchit le milliard de dollars de revenus et intègre ChatGPT à Devin

Cognition crosses $1B revenue run rate and integrates ChatGPT into Devin

Cognition a atteint le milliard de dollars de revenus récurrents annualisés. Parallèlement, la plateforme Devin permet désormais aux utilisateurs de se connecter directement via leur abonnement ChatGPT pour déduire les requêtes de leur quota.

5 comptes indépendants 27 messages 1 labos 99 575 interactions
devin
@MatthewBerman ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@cognition ses sujets sur X ↗
@jerryjliu0 ses sujets sur X ↗
@petergyang ses sujets sur X ↗
@thsottiaux ses sujets sur X ↗
@cwdegnan ses sujets sur X ↗
@iseff ses sujets sur X ↗
04 — architecture · 6e jour 14 VOIX

Anthropic publie Claude Sonnet 5.5, plus rapide et plus économique

Anthropic releases Claude Sonnet 5.5 with improved speed and efficiency

Anthropic a lancé Claude Sonnet 5.5, affichant une exécution plus rapide de plus de 30 % et des coûts réduits de 30 % par rapport à la version précédente. Cette mise à jour optimise l'efficacité pour les tâches quotidiennes de développement.

14 comptes indépendants 24 messages 5 labos 253 828 interactions
@AlexFinn ses sujets sur X ↗
@AndrewCurran_ ses sujets sur X ↗
@AnthropicAI ses sujets sur X ↗
@ClaudeDevs ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@_catwu ses sujets sur X ↗
05 — architecture NOUVEAU 21 VOIX

OpenAI déploie GPT-6.1 et corrige des bugs visuels sur la gamme GPT-6

OpenAI releases GPT-6.1 and patches vision bugs across GPT-6 models

OpenAI a déployé GPT-6.1 pour les abonnés et via son API, tout en corrigeant un bogue affectant la compréhension visuelle des modèles GPT-6 Sol et GPT-6 Luna.

21 comptes indépendants 120 messages 2 articles 5 labos 125 139 interactions
astragpt-6codexdeepseeknvidiaglmkimi k3deepswe
@AravSrinivas ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
06 — agents NOUVEAU 3 VOIX

OpenAI présente Dots, des agents autonomes fonctionnant en continu

OpenAI introduces Dots, autonomous agents operating around the clock

OpenAI a lancé Dots, des agents autonomes fonctionnant 24h/24 et 7j/7, dotés de leur propre environnement informatique virtuel, d'un navigateur et compatibles avec plus de 4 000 applications.

3 comptes indépendants 4 messages 2 labos 155 736 interactions
@OpenAI ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@minchoi ses sujets sur X ↗
@polynoamial ses sujets sur X ↗
07 — agents · 3e jour 9 VOIX

NVIDIA lance l'Open Agent Safety Platform combinant OpenShell et Sentry

NVIDIA Introduces Open Agent Safety Platform Combining OpenShell and Sentry

NVIDIA a lancé l'Open Agent Safety Platform, intégrant OpenShell et Sentry pour renforcer la sécurité des agents IA. Cette plateforme applique des politiques de sécurité et des limites de sandboxing lors de l'exécution de tâches prolongées par les agents.

9 comptes indépendants 15 messages 4 labos 148 482 interactions
@AndrewYNg ses sujets sur X ↗
@AravSrinivas ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@arthurmensch ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
08 — agents NOUVEAU 7 VOIX

Grok Bot se met à jour avec des fonctionnalités de gestion financière et de développement

Grok Bot Updates With Financial Management and Software Development Support

Grok Bot bénéficie de mises à jour pour le développement logiciel, incluant la délégation de tâches de code à Cursor et la gestion des pull requests via des plugins GitHub et Origin. Le système gère également des tâches financières.

7 comptes indépendants 62 messages 1 articles 2 labos 918 068 interactions
anthropicgooglegrokcursorsam altmanxai
@AlexFinn ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@Codie_Sanchez ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@cursor_ai ses sujets sur X ↗
@dotey ses sujets sur X ↗
@elonmusk ses sujets sur X ↗
09 — architecture NOUVEAU 4 VOIX

OpenAI lance le modèle GPT-6.1 Sol axé sur l'efficacité des coûts

OpenAI Launches GPT-6.1 Sol Model Focused on Cost Efficiency

OpenAI a annoncé le modèle GPT-6.1 Sol, offrant de hautes performances à un coût réduit pour les benchmarks de développement web. Ce nouveau modèle a été intégré aux plateformes d'évaluation Arena pour des tests.

4 comptes indépendants 7 messages 2 labos 53 446 interactions
@OpenAI ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@arena ses sujets sur X ↗
@polynoamial ses sujets sur X ↗
10 — system_design NOUVEAU 4 VOIX

Anthropic lance un nouveau portail pour les développeurs travaillant avec Claude

Anthropic Launches New Developer Portal for Claude Builders

Anthropic a lancé un site web dédié aux développeurs construisant des applications avec Claude. La plateforme propose des analyses techniques approfondies, des guides d'API, de la documentation Claude Code et des retours d'expérience.

4 comptes indépendants 6 messages 2 articles 2 labos 37 192 interactions
@ClaudeDevs ses sujets sur X ↗
@addyosmani ses sujets sur X ↗
@claudeai ses sujets sur X ↗
@dotey ses sujets sur X ↗
@simonw ses sujets sur X ↗
11 — multimodal · 2e jour 10 VOIX

Meta continue d'étendre sa gamme de produits Muse et ses fonctions d'assistant personnel

Meta Continues Expanding Muse Product Line and Personal Assistant Features

Meta a déployé de nombreuses mises à jour au sein de son écosystème Muse au cours des six derniers mois, incluant Muse Spark ainsi que des outils de génération d'images, de vidéo, d'audio et de code pour des assistants intégrés.

10 comptes indépendants 65 messages 1 labos 83 386 interactions
muse spark
@AIatMeta ses sujets sur X ↗
@AlexFinn ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
@VibeMarketer_ ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
12 — agents · 3e jour 3 VOIX

OpenAI se prépare à lancer des agents autonomes continus lors de sa conférence DevDay

OpenAI prepares to launch always-on agents at DevDay

OpenAI se prépare à tenir sa conférence DevDay pour présenter de nouveaux agents autonomes et continus intégrés aux abonnements professionnels. Ces systèmes sont conçus pour fonctionner en continu afin d'assister les utilisateurs. Cette annonce fait suite à plusieurs semaines de préparatifs et de teasers de la part des développeurs.

3 comptes indépendants 7 messages 1 articles 2 labos 58 736 interactions
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@testingcatalog ses sujets sur X ↗
13 — inference NOUVEAU 10 VOIX

Des plateformes déploient de nouveaux modèles et des vitesses de génération de tokens ultra-rapides

Platforms release new models and ultrafast token generation speeds

Plusieurs plateformes ont déployé de nouveaux modèles ainsi que des paliers de vitesse haut de gamme offrant des débits de tokens exceptionnels. Des systèmes tels que Gemini 3.8 Flash, GPT-6 Luna (Max) et TwIL-LM3-Pro atteignent des performances élevées avec des centaines de tokens par seconde et de larges fenêtres de contexte. Ces lancements incluent des options gratuites et payantes pour répondre à la demande.

10 comptes indépendants 23 messages 3 labos 28 204 interactions
tokens per secondqwen3.8qwen3gemmallama.cppgsm8k
@AlexFinn ses sujets sur X ↗
@Alibaba_Qwen ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@PrismML ses sujets sur X ↗
@arena ses sujets sur X ↗
@cline ses sujets sur X ↗
14 — agents NOUVEAU 5 VOIX

OpenRouter intègre des modèles de décision spécialisés pour les agents de codage

OpenRouter integrates specialized decision models for coding agents

OpenRouter a ajouté des modèles de décision tels que d1 et Kev 4B pour gérer les tâches de classification, de routage et de modération. Ces modèles offrent un traitement contextuel efficace et un fonctionnement économique pour les développeurs. Les agents de codage peuvent intégrer directement ces fonctionnalités via l'API Decisions pour optimiser les flux de travail.

5 comptes indépendants 35 messages 1 labos 22 542 interactions
openrouter
@CompleteSkeptic ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@cline ses sujets sur X ↗
@natolambert ses sujets sur X ↗
@ManusAI ses sujets sur X ↗
@RespanAI ses sujets sur X ↗
@alexatallah ses sujets sur X ↗
15 — architecture NOUVEAU 9 VOIX

Expansion de l'intégration du Model Context Protocol sur ChatGPT et Claude

Expansion of Model Context Protocol integration across ChatGPT and Claude

ChatGPT et Claude ont déployé de nouvelles fonctionnalités prenant en charge le Model Context Protocol (MCP) pour simplifier le développement et la gestion des plugins. ChatGPT Sites peut désormais héberger des serveurs MCP et des extensions de plugins. Parallèlement, un nouveau portail a été lancé pour permettre aux développeurs de soumettre des plugins et de suivre leur utilisation.

9 comptes indépendants 38 messages 5 labos 34 587 interactions
model context protocol
@ClaudeDevs ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@bcherny ses sujets sur X ↗
@c_valenzuelab ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
@ideabrowser ses sujets sur X ↗
16 — evaluation · 4e jour 7 VOIX

Claude Opus 5.5 améliore la précision et réduit les taux d'hallucination

Claude Opus 5.5 improves accuracy and reduces hallucination rates

La version Claude Opus 5.5 présente des améliorations notables en termes de précision, de rapidité et de concision par rapport aux itérations précédentes. Le modèle obtient d'excellents scores sur des benchmarks tels que Drone-Bench avec des taux d'erreur réduits. De plus, des outils intégrés comme Claude Tag élargissent leurs capacités d'accès sécurisé aux données personnelles.

7 comptes indépendants 36 messages 1 articles 3 labos 37 587 interactions
claude fable
@AravSrinivas ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@bcherny ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@dotey ses sujets sur X ↗
17 — multimodal · 3e jour 5 VOIX

World Labs présente le modèle du monde multi-agent Agora-2

World Labs introduces the Agora-2 multi-agent world model

World Labs a dévoilé Agora-2, un modèle du monde multi-agent de nouvelle génération prenant en charge jusqu'à 20 humains et agents interagissant dans un environnement partagé en temps réel. Parallèlement, la recherche fondamentale sur les modèles du monde progresse avec l'arrivée de figures éminentes au sein de laboratoires tels que Sakana AI.

5 comptes indépendants 24 messages 1 articles 4 labos 41 197 interactions
world model
@ClementDelangue ses sujets sur X ↗
@SchmidhuberAI ses sujets sur X ↗
@_akhaliq ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@hardmaru ses sujets sur X ↗
@iScienceLuvr ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
18 — inference · 2e jour 3 VOIX

Ollama ajoute la prise en charge de l'exécution locale pour les modèles de décision

Ollama adds local execution support for decision models

Ollama a introduit la prise en charge native de l'exécutable local pour les modèles de décision tels que Nimble et les variantes légères de Tev1. Ces modèles permettent aux utilisateurs d'exécuter des tâches telles que le routage de tickets, la classification et la modération de contenu entièrement sur du matériel local avec une latence minimale.

3 comptes indépendants 10 messages 13 498 interactions
ollama
@dani_avila7 ses sujets sur X ↗
@nutlope ses sujets sur X ↗
@ollama ses sujets sur X ↗
@CrusoeAI ses sujets sur X ↗
@HakanGecili2 ses sujets sur X ↗
@sojoodi ses sujets sur X ↗
19 — system_design NOUVEAU 4 VOIX

Récapitulatif des annonces majeures et des lancements de produits lors de l'OpenAI DevDay

Recap of major announcements and product launches at OpenAI DevDay

OpenAI a tenu sa conférence DevDay, présentant de nouveaux lancements de produits et des mises à jour de plateformes. Les développeurs ont examiné l'ensemble des annonces présentées sur scène.

4 comptes indépendants 5 messages 2 articles 2 labos 7 147 interactions
@OpenAIDevs ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@thsottiaux ses sujets sur X ↗
20 — system_design NOUVEAU 4 VOIX

Enquête sur une campagne d'extraction de raisonnement et mission test de TPU en orbite

Inquiry into reasoning extraction campaign and orbital TPU test mission

Des opérations liées à des développeurs de Moonshot AI ont été identifiées derrière une campagne cherchant à extraire des jetons de raisonnement cachés des modèles. Parallèlement, des équipes techniques ont programmé une mission de test orbitale avec un satellite prototype pour évaluer la performance des processeurs TPU de Google dans l'espace.

4 comptes indépendants 16 messages 1 articles 1 labos 26 537 interactions
moonshot aigemini 3.1 flashalibaba
@AndrewCurran_ ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@Google ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@natolambert ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@PeterDiamandis ses sujets sur X ↗
21 — agents NOUVEAU 3 VOIX

DSPy publie la version 3.4.0 avec un support natif de System One et un nouvel optimiseur

DSPy releases version 3.4.0 with native System One support and new optimizer

La version 3.4.0 de DSPy a introduit un support natif pour les modèles System One ainsi qu'un nouvel optimiseur nommé ReAnchor. Cette mise à jour offre des outils de programmation améliorés pour les développeurs construisant des boucles d'agents personnalisées.

3 comptes indépendants 18 messages 2 articles 1 labos 10 906 interactions
dspy
@CompleteSkeptic ses sujets sur X ↗
@lateinteraction ses sujets sur X ↗
@typesafeai ses sujets sur X ↗
@DSPyOSS ses sujets sur X ↗
@MaximeRivest ses sujets sur X ↗
@dbreunig ses sujets sur X ↗
@deepfates ses sujets sur X ↗
@dotpem ses sujets sur X ↗
22 — agents NOUVEAU 5 VOIX

Google DeepMind publie de nouveaux essais sur la trajectoire de l'AGI et les essaims d'agents

Google DeepMind publishes new essays on AGI trajectory and agent swarms

Google DeepMind a publié une série d'essais abordant le contrôle des comportements dans les essaims d'agents et la transition vers l'intelligence artificielle générale. Les publications projettent une augmentation significative de l'utilisation des jetons à mesure que les agents autonomes se développent d'ici 2030.

5 comptes indépendants 17 messages 7 336 interactions
google deepmind
@Hesamation ses sujets sur X ↗
@ShaneLegg ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@dair_ai ses sujets sur X ↗
@eptwts ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@testingcatalog ses sujets sur X ↗
23 — system_design NOUVEAU 3 VOIX

La mise à jour MiMo-V2.6 corrige la répétition des appels d'outils tandis que de nouveaux modèles discrets apparaissent

MiMo-V2.6 update fixes tool-call repetition while new stealth models appear

La série de modèles MiMo-V2.6 a reçu une mise à jour résolvant un problème d'appels d'outils répétitifs qui bloquait l'exécution des tâches. En outre, les plateformes ont déployé des aperçus de nouveaux modèles dotés de fenêtres de contexte élargies.

3 comptes indépendants 13 messages 1 articles 2 labos 5 553 interactions
opencode
@GithubProjects ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@thsottiaux ses sujets sur X ↗
@XiaomiMiMoDevs ses sujets sur X ↗
24 — architecture NOUVEAU 3 VOIX

Débat sur la position de l'Europe dans la course aux modèles d'intelligence artificielle frontaliers

Discussion on the capabilities of Europe's frontier AI labs and Mistral AI

La communauté technologique débat de la compétitivité des laboratoires de recherche en intelligence artificielle en Europe et de la stratégie de développement de Mistral AI. Les discussions portent sur la capacité de la région à maintenir des projets de niveau frontalier.

3 comptes indépendants 7 messages 6 056 interactions
mistral ai
@emollick ses sujets sur X ↗
@rasbt ses sujets sur X ↗
@saranormous ses sujets sur X ↗
@Cloudflare ses sujets sur X ↗
@alex_verem ses sujets sur X ↗
25 — agents · 3e jour 3 VOIX

LangChain intègre Parallel et lance l'outil de fine-tuning LangSmith

LangChain integrates Parallel and launches the LangSmith fine-tuning tool

LangChain a intégré Parallel dans ses agents gérés et a lancé le fine-tuning LangSmith en partenariat avec Baseten et Fireworks AI. Cette mise à jour vise à traiter les données et à optimiser les trajectoires d'interaction dans les systèmes d'agents.

3 comptes indépendants 27 messages 4 005 interactions
langchain
@CompleteSkeptic ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
@Box ses sujets sur X ↗
@FireworksAI_HQ ses sujets sur X ↗
@GitMaxd ses sujets sur X ↗
@SlackHQ ses sujets sur X ↗
@Vtrivedy10 ses sujets sur X ↗

À lire de près

24 lectures

Articles et papiers, lus depuis leur résumé, classés par pertinence pour qui construit des agents et du backend.

03 — architecture 26 votes

Context Language Models

QUESTION — Comment les grands modèles de langage peuvent-ils gérer nativement leur propre contexte en le traitant comme un fichier ?

Atteint une précision supérieure de 11,4 % avec 21,5 % de FLOPs en moins sur BrowseComp-Plus.

rulins · 29 sept. 2026 lire l'original ↗
05 — agents 106 votes

Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

QUESTION — L'allocation de calcul au moment de l'inférence à la frontière entre le modèle et le harnais peut-elle améliorer la fiabilité des actions des agents de terminal?

Sur TerminalBench-Lite, un vérificateur GPT-5.6 Sol fait passer le Pass@1 de 50,00 % pour l'agent de base à 68,03 % avec 8 actions échantillonnées.

Nardien · 30 sept. 2026 lire l'original ↗
06 — agents 76 votes

Follow the Entities: A Corpus Map for Agentic Search

QUESTION — Comment les agents peuvent-ils améliorer la découverte et la synthèse d'informations à travers de grandes collections de documents sans consommation excessive de tokens ?

CorpusMap organise le corpus autour d'entités récurrentes pour lier des documents provenant de différentes sources.

starsuzi · 29 sept. 2026 lire l'original ↗
07 — agents 65 votes

LLMs are General Asynchronous Agents

QUESTION — Comment généraliser différentes tâches asynchrones en agents asynchrones généraux capables de s'adapter à divers types de concurrence sans entraînement spécifique à une tâche ?

Le framework permet aux utilisateurs ou aux agents de définir des coroutines d'inférence avec des états de mémoire chevauchants.

MrDarkTesla · 28 sept. 2026 lire l'original ↗
08 — agents 40 votes

Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

QUESTION — Comment un modèle Builder peut-il apprendre des méta-compétences à partir des retours d'exécution pour construire de meilleurs harnais d'exécution pour un modèle Target lors de l'IA pour l'IA au moment du test ?

Les méta-compétences de la banque complète améliorent les performances macro-moyennes de 8.95 points de pourcentage par rapport à une construction sans compétence.

chengq9 · 29 sept. 2026 lire l'original ↗
10 — agents 14 votes

AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation

QUESTION — Comment le code de harness pour la génération d'images multi-références par agents peut-il être optimisé automatiquement tout en maintenant les modèles gelés ?

AutoRef-Harness improves the open-weight FLUX.2 [klein] 4B from 5.72 to 7.37 on held-out four-reference tasks of the MultiBanana benchmark.

shim0114 · 28 sept. 2026 lire l'original ↗
11 — training 12 votes

EasyPPO: Stabilizing the Critic Is Key

QUESTION — Quels modes de défaillance liés au critique déstabilisent l'optimisation par politique proximale (PPO) lors de l'entraînement des grands modèles de langage ?

Les meilleurs scores de validation d'EasyPPO montrent des gains relatifs de 14.89% sur FrontierCS par rapport à PPO.

wchai · 29 sept. 2026 lire l'original ↗
14 — inference 29 votes

SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video

QUESTION — Comment pouvons-nous transformer des sorties de modèles vidéo basse résolution en une résolution 4K à l'aide d'un raffineur de débruitage en une seule étape?

SoL-Refiner réalise une accélération de 8,91 fois de la latence de raffinement par rapport à la même base de référence dans le paramètre de latence 2K.

Owen777 · 29 sept. 2026 lire l'original ↗
19 — training 221 votes

Scaling Properties of Same-Family On-Policy Distillation

QUESTION — Quelles sont les propriétés de mise à l'échelle de la distillation en politique (on-policy) à travers différentes configurations weak-to-strong, same-base et strong-to-weak ?

La précision retenue augmente approximativement de manière linéaire avec la racine carrée de la divergence KL inverse au niveau des tokens pendant le régime de transfert utile.

colored-dye · 26 sept. 2026 lire l'original ↗
23 — multimodal 16 votes

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

QUESTION — Comment les grands modèles de langage multimodaux peuvent-ils intégrer des images multi-vues pour comprendre une scène 3D cohérente avant de répondre ?

Imagine3D-LLM learns to assemble a similar compact 3D representation of the scene and conditions its answer on this representation.

HwanChang0106 · 29 sept. 2026 lire l'original ↗
24 — inference 12 votes

Chinese-Jev: Bringing System One Model to Chinese-Language Tasks

QUESTION — Comment adapter un modèle de Système Un (System One) pour les tâches de décision en langue chinoise afin d'atteindre une vitesse et une précision élevées ?

Après le pré-entraînement de première étape, Chinese-Jev dépasse la précision du modèle Jev fermé de 1.24% sur les tâches du domaine général tout en réalisant une accélération de 20.3x.

ZhaoHaoyuu · 29 sept. 2026 lire l'original ↗

Sur le terrain

2026-10-01

Dépôts qui montent sur GitHub aujourd'hui, notés sur l'élan du jour, le rang, l'adoption, la fraîcheur et la santé du projet.

01 debpalash/VoiceStudio +3 483 Cette suite locale de clonage vocal et d'audio convient aux ingénieurs backend intégrant la voix dans des agents. Python
★ 50 804
02 NVIDIA/OpenShell +1 281 Un runtime sécurisé en Rust pour exécuter des agents autonomes, conçu pour les ingénieurs backend gérant des environnements isolés. Rust
★ 13 242
03 DietrichGebert/ponytail +743 Un cadre d'agent de codage conçu pour écrire un minimum de code, destiné aux développeurs. JavaScript
★ 149 524
04 mvschwarz/openrig +624 Un harnais multi-agents orchestrant Claude Code et Codex, idéal pour les ingénieurs concevant des agents de codage. TypeScript
★ 3 205
05 mattpocock/skills +876 Une collection de compétences et de configurations shell pour les ingénieurs optimisant les flux de travail avec des agents de code. Shell
★ 273 243
06 heygen-com/hyperframes +349 Convertit du HTML en vidéo, conçu pour permettre aux agents d'automatiser la génération de contenu. TypeScript
★ 54 902
07 VectifyAI/PageIndex +1 097 Un moteur d'indexation de documents sans vecteur pour le RAG basé sur le raisonnement, idéal pour les ingénieurs backend. Python
★ 38 257
08 t8y2/dbx +1 138 Un client de base de données léger en Rust intégrant un serveur MCP et de l'IA, destiné aux développeurs backend. Rust
★ 23 443
09 openclaw/openclaw +136 Une plateforme d'agents multiplateforme conçue pour exécuter des tâches autonomes au niveau du système. TypeScript
★ 391 067
10 mksglu/context-mode +90 Outil d'optimisation de la fenêtre de contexte pour les agents de codage via MCP et le sandboxing. TypeScript
★ 24 572
11 colbymchenry/codegraph +118 Un graphe de connaissances de code local qui réduit l'utilisation des jetons pour les agents de codage. C
★ 72 678
12 ComposioHQ/awesome-claude-skills +123 Une liste de ressources pour personnaliser et étendre les flux de travail et les compétences de Claude AI. Python
★ 76 227
13 modelcontextprotocol/servers +50 Une collection de serveurs MCP standardisés pour connecter des sources de données et des outils aux LLM. TypeScript
★ 90 874
↑