CONSONANCE.for your information
lundi 5 octobre 2026frenvi
FICHE N° 2026-10-03RADAR IA & AGENTS

Trois voix, et ça devient une nouvelle.

Radar IA et agents. Chaque matin, et seulement ce que plusieurs sources indépendantes disent en même temps.

Vidéo du jour

bobine n° 7 · 1:15
ÉTIQUETTEinference · 23 voix

Claude Sonnet 5.5 sort avec une vitesse accrue de 30% et une isolation des sessions

Claude Sonnet 5.5 a été lancé avec une vitesse supérieure de 30% et des coûts réduits pour les tâches courantes. Il intègre une conservation de la réflexion pour empêcher les attaques de distillation lors du changement de compte.

GÉNÉRÉE AUTOMATIQUEMENT
Transcription

Consonance, bobine n° 7.

Samedi 3 octobre : ce que plusieurs voix indépendantes disent en même temps.

Les performances s'accélèrent et les plateformes s'ouvrent aux développeurs.

Claude Sonnet 5.5 sort avec une vitesse accrue de 30 pour cent.

ChatGPT ouvre sa plateforme pour permettre la création d'applications natives.

Codex ajoute des paliers de vitesse supérieure et des environnements cloud.

Les capacités des modèles progressent avec de nouveaux lancements.

Google lance Gemini 4 Argon avec une limite de sortie d'un million de tokens.

Claude Code prend en charge les modifications d'interface et de comportement.

Fireworks Research lance Ember-1 basé sur Kimi K3.

L'écosystème se dote de nouveaux outils de sécurité et d'hébergement.

Muse fait face à des critiques sur la confidentialité et lance un micrologiciel open source.

NVIDIA présente Open Agent Safety Platform pour sécuriser l'exécution des agents.

ChatGPT Sites prend en charge l'hébergement et le déploiement de serveurs MCP.

Cette étude présente HybridCUA, un cadre qui combine les interfaces graphiques et les lignes de commande.

Elle montre comment améliorer les agents d'utilisation d'ordinateurs grâce à un entraînement en deux étapes.

27 sujets aujourd'hui, trois voix indépendantes au minimum pour chacun.

Les sources sont sur consonance.fyi.

En discussion

27 · sujets

Sujets repris par au moins trois comptes indépendants sur les sept derniers jours.

01 — architecture NOUVEAU 14 VOIX

Google lance Gemini 4 Argon avec une limite de sortie de 1 million de tokens

Google releases Gemini 4 Argon with a 1M token output limit

Google a introduit Gemini 4 Argon, offrant des performances accrues dans les flux de travail de génie logiciel et de cybersécurité. Le modèle intègre une limite de sortie d'un million de tokens tout en affichant des coûts compétitifs sur les indices d'évaluation.

14 comptes indépendants 95 messages 1 articles 2 labos 387 865 interactions
googledeepswegeminiterminal-benchartificial analysisgemini 3.8gemini 3.1 flashweathernext
@AndrewCurran_ ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@GeminiApp ses sujets sur X ↗
@Google ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OfficialLoganK ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
02 — agents NOUVEAU 14 VOIX

Claude Code prend en charge les modifications d'interface et de comportement

Claude Code adds support for custom mods and UI modifications

Claude Code permet désormais aux utilisateurs de personnaliser l'interface, de modifier les comportements et d'intégrer des fonctionnalités via des plugins en TypeScript. La mise à jour ajoute également des outils de création d'évaluations pour optimiser les applications.

14 comptes indépendants 65 messages 1 articles 4 labos 220 264 interactions
claude code
@AlexFinn ses sujets sur X ↗
@AndrewCurran_ ses sujets sur X ↗
@ClaudeDevs ses sujets sur X ↗
@CuiMao ses sujets sur X ↗
@HamelHusain ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
03 — system_design NOUVEAU 15 VOIX

ChatGPT ouvre sa plateforme pour permettre la création d'applications natives

ChatGPT opens its platform allowing users to build native plugin apps

La plateforme ChatGPT s'ouvre pour permettre aux développeurs de concevoir et de déployer des applications de plugins natives directement dans les conversations, ciblant une vaste base d'utilisateurs hebdomadaires.

15 comptes indépendants 86 messages 3 labos 184 743 interactions
chatgpt
@AndrewBolis ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@SchmidhuberAI ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
@ajambrosino ses sujets sur X ↗
04 — system_design · 2e jour 15 VOIX

Codex ajoute des paliers de vitesse supérieure et des environnements cloud

Codex adds premium speed tiers and cloud environments

Codex a déployé un palier de vitesse supérieure baptisé Ultrafast, augmentant le débit de génération de tokens dans l'API et les interfaces de programmation. La mise à jour introduit également des environnements cloud réutilisables.

15 comptes indépendants 71 messages 5 labos 148 588 interactions
codex
@GithubProjects ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@VibeMarketer_ ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@ajambrosino ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
05 — agents NOUVEAU 6 VOIX

La plateforme Devin intègre les quotas d'abonnement ChatGPT

Devin coding platform integrates ChatGPT subscription quotas

La plateforme Devin permet désormais aux utilisateurs de se connecter avec leurs abonnements ChatGPT Plus ou Pro pour déduire directement leurs quotas d'utilisation, tout en annonçant des réductions de tarifs sur plusieurs forfaits.

6 comptes indépendants 24 messages 1 labos 97 704 interactions
devin
@ArtificialAnlys ses sujets sur X ↗
@MatthewBerman ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@cognition ses sujets sur X ↗
@jerryjliu0 ses sujets sur X ↗
@petergyang ses sujets sur X ↗
@thsottiaux ses sujets sur X ↗
@cwdegnan ses sujets sur X ↗
06 — system_design · 2e jour 9 VOIX

ChatGPT Sites prend en charge l'hébergement et le déploiement de serveurs MCP

ChatGPT Sites adds support for hosting and deploying MCP servers

ChatGPT Sites permet aux utilisateurs d'héberger et de déployer directement des serveurs Model Context Protocol via la plateforme. Cette fonctionnalité facilite la création et le partage d'extensions de données.

9 comptes indépendants 28 messages 3 articles 6 labos 37 795 interactions
model context protocol
@AravSrinivas ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@c_valenzuelab ses sujets sur X ↗
@huggingface ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
@ideabrowser ses sujets sur X ↗
@petergyang ses sujets sur X ↗
07 — agents NOUVEAU 12 VOIX

Muse fait face à des critiques sur la confidentialité et lance un micrologiciel open source

Muse faces privacy backlash over user data leaks and releases open-source hardware firmware

L'application Muse a fait l'objet de vives critiques en matière de confidentialité après avoir divulgué des données sensibles d'utilisateurs. Parallèlement, le projet a annoncé un micrologiciel ESP32 open source et un SDK Linux pour le développement de matériel compatible.

12 comptes indépendants 57 messages 1 articles 1 labos 112 045 interactions
muse spark
@AIatMeta ses sujets sur X ↗
@AlexFinn ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@VibeMarketer_ ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
08 — inference NOUVEAU 23 VOIX

Claude Sonnet 5.5 sort avec une vitesse accrue de 30% et une isolation des sessions

Claude Sonnet 5.5 releases with 30% faster speed and isolated context thinking

Claude Sonnet 5.5 a été lancé avec une vitesse supérieure de 30% et des coûts réduits pour les tâches courantes. Il intègre une conservation de la réflexion pour empêcher les attaques de distillation lors du changement de compte.

23 comptes indépendants 83 messages 2 articles 5 labos 334 964 interactions
claude sonnet
@AlexFinn ses sujets sur X ↗
@AndrewCurran_ ses sujets sur X ↗
@AnthropicAI ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@ClaudeDevs ses sujets sur X ↗
@FactoryAI ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
09 — evaluation NOUVEAU 8 VOIX

Les évaluations de Claude 5.5 et Fable 5.5 montrent des taux d'hallucination réduits

Performance evaluations of Claude 5.5 and Fable 5.5 reveal reduced hallucination rates

Les tests de référence indiquent qu'Opus 5.5 affiche des taux d'hallucination réduits et de bons scores aux évaluations. Parallèlement, les utilisateurs signalent le routage des requêtes vers Fable 5.5 avec des résultats améliorés.

8 comptes indépendants 50 messages 2 labos 52 072 interactions
claude fable
@AravSrinivas ses sujets sur X ↗
@EMostaque ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@arena ses sujets sur X ↗
@dotey ses sujets sur X ↗
@emollick ses sujets sur X ↗
@haider1 ses sujets sur X ↗
10 — system_design NOUVEAU 8 VOIX

Anthropic dépose son dossier d'IPO et affiche une forte croissance de son chiffre d'affaires

Anthropic files for IPO, revealing 1,088% revenue growth and surging compute costs

Anthropic a déposé son dossier d'introduction en bourse, affichant un chiffre d'affaires de 4,59 milliards de dollars, soit une hausse de 1 088 % par rapport à l'exercice précédent. Le document souligne également la forte augmentation des coûts de calcul.

8 comptes indépendants 69 messages 1 articles 3 labos 62 273 interactions
anthropicxai
@AndrewCurran_ ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@TheRundownAI ses sujets sur X ↗
@aidangomez ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@dani_avila7 ses sujets sur X ↗
@dotey ses sujets sur X ↗
@eptwts ses sujets sur X ↗
11 — system_design · 3e jour 4 VOIX

Anthropic lance un nouveau portail destiné aux développeurs de l'écosystème

Anthropic launches new developer portal for engineering guides and resources

Anthropic a introduit un portail dédié aux développeurs regroupant des analyses techniques approfondies et des guides d'utilisation. Sonnet 5.5 a également été déployé pour alimenter la version gratuite de la plateforme web.

4 comptes indépendants 5 messages 2 articles 2 labos 56 517 interactions
@ClaudeDevs ses sujets sur X ↗
@addyosmani ses sujets sur X ↗
@claudeai ses sujets sur X ↗
@dotey ses sujets sur X ↗
@simonw ses sujets sur X ↗
12 — agents · 6e jour 12 VOIX

NVIDIA présente Open Agent Safety Platform pour sécuriser l'exécution des agents

NVIDIA introduces Open Agent Safety Platform to secure AI agent execution

NVIDIA s'est associé à plus de 100 partenaires industriels pour lancer l'Open Agent Safety Platform, combinant OpenShell et Sentry. L'infrastructure fournit un environnement d'exécution sécurisé doté de limites strictes pour les agents.

12 comptes indépendants 57 messages 6 labos 197 881 interactions
nvidia
@AndrewYNg ses sujets sur X ↗
@AravSrinivas ses sujets sur X ↗
@ClementDelangue ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@NVIDIAAI ses sujets sur X ↗
@arthurmensch ses sujets sur X ↗
@cognition ses sujets sur X ↗
13 — agents · 3e jour 3 VOIX

OpenAI présente Dots, des agents IA autonomes fonctionnant 24h/24 et 7j/7

OpenAI introduces Dots, autonomous 24/7 AI agents operating across applications

OpenAI a lancé Dots, une gamme d'agents autonomes conçus pour piloter des ordinateurs, des navigateurs et des milliers d'applications. Le système est capable d'exécuter des flux de travail complexes et de gérer des tâches de service.

3 comptes indépendants 5 messages 2 labos 156 811 interactions
@OpenAI ses sujets sur X ↗
@PromptLLM ses sujets sur X ↗
@minchoi ses sujets sur X ↗
@polynoamial ses sujets sur X ↗
@swyx ses sujets sur X ↗
14 — agents NOUVEAU 3 VOIX

OpenAI développe un assistant en concurrence avec les offres de bots existantes

OpenAI develops assistant competing with existing bot offerings

OpenAI lance Dots, un assistant doté d'un accès aux mémoires ChatGPT et conçu pour fonctionner en continu 24h/24 et 7j/7 en tant qu'extension de l'utilisateur.

3 comptes indépendants 5 messages 1 labos 78 780 interactions
@AlexFinn ses sujets sur X ↗
@OpenAI ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@minchoi ses sujets sur X ↗
15 — training NOUVEAU 10 VOIX

Fireworks Research lance Ember-1 basé sur Kimi K3

Fireworks Research releases Ember-1 built on Kimi K3

Fireworks Research a développé Ember-1 sur la base du modèle Kimi K3. Ce modèle a bénéficié d'un entraînement postérieur pour réduire la redondance dans son raisonnement, permettant d'économiser environ 40 % de jetons tout en conservant des performances équivalentes sur les benchmarks.

10 comptes indépendants 51 messages 2 labos 25 620 interactions
deepseekkimi k3deepseek v4deepseek v4.1 flash
@AndrewCurran_ ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@OpenRouter ses sujets sur X ↗
@aiedge_ ses sujets sur X ↗
@alex_prompter ses sujets sur X ↗
@arankomatsuzaki ses sujets sur X ↗
@arena ses sujets sur X ↗
@cline ses sujets sur X ↗
16 — system_design · 2e jour 5 VOIX

OpenAI modifie le calcul d'utilisation pour l'abonnement Pro à 200 dollars

OpenAI modifies usage calculation for the $200 Pro subscription

OpenAI rouvre les abonnements Pro à 200 dollars aux nouveaux utilisateurs tout en modifiant le mode de calcul de l'utilisation. Ce changement réduit de moitié les quotas équivalents à l'API pour ce niveau d'abonnement.

5 comptes indépendants 15 messages 1 labos 58 112 interactions
@AlexFinn ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@alliekmiller ses sujets sur X ↗
@eptwts ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@op7418 ses sujets sur X ↗
@scaling01 ses sujets sur X ↗
@testingcatalog ses sujets sur X ↗
17 — multimodal · 2e jour 8 VOIX

Qwen3.8-27B optimisé pour les tâches de décision multimodales

Qwen3.8-27B optimized for multimodal decision-making tasks

Le modèle Qwen3.8-27B a été transformé en un modèle de décision multimodal capable de prendre des décisions en moins de 100 ms à partir de l'état de jeux en direct. Ce modèle dense est désormais accessible via Nebius pour la création d'agents et les flux de travail complexes.

8 comptes indépendants 27 messages 1 articles 2 labos 18 154 interactions
deepseek v4 flashsglangqwen3gemmaqwen3.8comfyui
@Alibaba_Qwen ses sujets sur X ↗
@ArtificialAnlys ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@Gradio ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@dair_ai ses sujets sur X ↗
@haider1 ses sujets sur X ↗
@iScienceLuvr ses sujets sur X ↗
18 — inference NOUVEAU 4 VOIX

OpenRouter ajoute le modèle Pareto 26.10 Preview

OpenRouter adds Pareto 26.10 Preview model

OpenRouter a intégré le modèle Pareto 26.10 Preview au tarif de 0,80 dollar par million de jetons en entrée et 3,20 dollars par million en sortie. Il s'agit d'un modèle composite multimodal destiné à la recherche, au code et aux flux de travail autonomes.

4 comptes indépendants 39 messages 1 articles 2 labos 31 733 interactions
openrouter
@OpenRouter ses sujets sur X ↗
@cline ses sujets sur X ↗
@heyshrutimishra ses sujets sur X ↗
@mustafasuleyman ses sujets sur X ↗
@natolambert ses sujets sur X ↗
@ManusAI ses sujets sur X ↗
@PhotonHQ ses sujets sur X ↗
@alexatallah ses sujets sur X ↗
19 — inference · 4e jour 6 VOIX

Llama.cpp intègre l'exécution locale de modèles de décision via l'endpoint /v1/systemone

Llama.cpp adds local support for decision models through the /v1/systemone endpoint

Llama.cpp prend désormais en charge les modèles de décision via l'endpoint /v1/systemone. Les utilisateurs peuvent exécuter ces modèles localement sur leurs appareils de manière efficace et confidentielle.

6 comptes indépendants 16 messages 1 articles 1 labos 12 651 interactions
deepseek r1llamasoraveollama.cppgsm8k
@ClementDelangue ses sujets sur X ↗
@GithubProjects ses sujets sur X ↗
@Hesamation ses sujets sur X ↗
@arena ses sujets sur X ↗
@gregisenberg ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
20 — agents · 5e jour 3 VOIX

OpenAI annonce des agents autonomes permanents pour son prochain événement DevDay

OpenAI teases always-on agent capabilities for upcoming DevDay event

OpenAI a dévoilé l'arrivée prochaine d'agents autonomes permanents pour les utilisateurs professionnels à la veille de son événement DevDay, conçus pour fonctionner en continu.

3 comptes indépendants 7 messages 1 articles 2 labos 58 736 interactions
@OpenAI ses sujets sur X ↗
@OpenAIDevs ses sujets sur X ↗
@derrickcchoi ses sujets sur X ↗
@kimmonismus ses sujets sur X ↗
@testingcatalog ses sujets sur X ↗
21 — multimodal · 3e jour 3 VOIX

World Labs rejoint l'écosystème AMD pour développer des modèles du monde

World Labs joins the AMD ecosystem to develop world models

World Labs a rejoint l'écosystème AMD afin de combiner ses expertises en IA et en modèles du monde. Cette collaboration vise à faire progresser la recherche et le développement de modèles de fondation mondiaux pour l'IA physique.

3 comptes indépendants 17 messages 4 labos 17 751 interactions
world model
@ClementDelangue ses sujets sur X ↗
@c_valenzuelab ses sujets sur X ↗
@iScienceLuvr ses sujets sur X ↗
@rohanpaul_ai ses sujets sur X ↗
@HaoranZhuX ses sujets sur X ↗
@LisaSu ses sujets sur X ↗
@camiinthisthang ses sujets sur X ↗
@cosmo_shirley ses sujets sur X ↗
22 — inference NOUVEAU 3 VOIX

Cohere lance la famille de modèles d'intégration Embed 5

Cohere launches the Embed 5 embedding model family

Cohere a présenté Embed 5, une nouvelle famille de modèles d'intégration comprenant la version haute performance Embed 5 Pro et la version à faible latence Embed 5 Fast. Cette sortie apporte des capacités de pointe aux applications de recherche et de traitement du langage.

3 comptes indépendants 22 messages 1 articles 2 labos 4 981 interactions
vllmcohere
@aidangomez ses sujets sur X ↗
@cohere ses sujets sur X ↗
@vllm_project ses sujets sur X ↗
@1vnzh ses sujets sur X ↗
@IQuest_research ses sujets sur X ↗
@Nils_Reimers ses sujets sur X ↗
@PrimeIntellect ses sujets sur X ↗
@PyTorch ses sujets sur X ↗
23 — agents · 2e jour 4 VOIX

LangChain publie des mises à jour pour Deep Agents et les adaptateurs MCP

LangChain releases updates for Deep Agents and MCP adapters

LangChain a publié la version 2.0 de ses adaptateurs MCP, prenant en charge la dernière version sans état du protocole pour les agents TypeScript. La plateforme a également mis à jour sa formation LangChain Academy pour introduire des agents profonds gérés afin de simplifier le déploiement.

4 comptes indépendants 21 messages 3 589 interactions
langchain
@AndrewBolis ses sujets sur X ↗
@CompleteSkeptic ses sujets sur X ↗
@LangChain ses sujets sur X ↗
@hwchase17 ses sujets sur X ↗
@LangChain_JS ses sujets sur X ↗
@PrefectIO ses sujets sur X ↗
@amadaecheverria ses sujets sur X ↗
@assaf_elovic ses sujets sur X ↗

À lire de près

24 lectures

Articles et papiers, lus depuis leur résumé, classés par pertinence pour qui construit des agents et du backend.

01 — agents 11 votes

HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents

QUESTION — Comment combiner efficacement les interfaces graphiques et les lignes de commande pour les agents d'utilisation d'ordinateurs ?

HybridCUA-9B achieves 53.6% accuracy on OSWorld, improving over the base model by 14.8 percentage points, and improves performance on WindowsAgentArena by 4.0 percentage points.

LZXzju · 29 sept. 2026 lire l'original ↗
02 — agents 11 votes

Marathoner: Ultra-Long-Horizon Autonomous Intelligence

QUESTION — Comment entraîner un modèle d'agent autonome à exécuter de manière fiable des tâches sur un horizon ultra-long ?

Marathoner achieves consistent and substantial performance improvements over base model and even surpasses performance of strong proprietary model.

Ruiyang-061X · 28 sept. 2026 lire l'original ↗
06 — agents 14 votes

CUA-SWE: When Computer-Use Agents Meet Visual Software Engineering

QUESTION — Les agents logiciels peuvent-ils accomplir des tâches d'ingénierie logicielle lorsque les informations opérationnelles requises ne sont disponibles que via l'interface visuelle de l'application en cours d'exécution ?

CUA-SWE fournit un banc d'essai unifié couvrant quatre domaines de l'ingénierie logicielle.

kingofspace0wzz · 26 sept. 2026 lire l'original ↗
08 — inference 12 votes

WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms

QUESTION — Comment optimiser la quantification du cache KV à faible nombre de bits à l'aide de transformations adaptées aux données pour minimiser l'erreur de reconstruction ?

WUSH-KV utilise des données d'étalonnage pour construire des transformations de clés et de valeurs distinctes.

softmax · 29 sept. 2026 lire l'original ↗
09 — architecture 11 votes

WorldAttention: An Efficient Attention Architecture for Interactive Video World Models

QUESTION — Quelle architecture d'attention peut résoudre la saturation de la mémoire du cache KV et la complexité de calcul dans les modèles mondiaux vidéo ?

WorldAttention consistent surpass prior state-of-the-art methods, achieving subject consistency scores of 0.9472 on VBench-Long and 0.9668 on InterVBench, respectively.

SteveZeyuZhang · 28 sept. 2026 lire l'original ↗
10 — agents 11 votes

RSIGame: Autonomous Agentic Game Development with Recursive Self-improvement

QUESTION — Comment automatiser le développement de jeux à l'aide de cadres d'agents dotés de mécanismes d'auto-amélioration récursive ?

Notably, experience internalization enables Qwen3.8-27B to reach 61.38 on Godot and 58.53 on Phaser, exceeding GPT-5.5 one-shot scores while reducing Qwen's generation tokens by 11 times.

WenyiWU0111 · 30 sept. 2026 lire l'original ↗
13 — training 31 votes

CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

QUESTION — Comment empêcher les récompenses à grande échelle de dominer la normalisation et de supprimer les signaux provenant de récompenses à plus petite échelle dans l'optimisation de politique relative de groupe multi-récompense?

CorrGRPO convertit les covariances par paires en coefficients de corrélation de Pearson pour équilibrer l'influence de récompenses d'échelles différentes.

hubin · 29 sept. 2026 lire l'original ↗
14 — training 31 votes

RPTune: Learned Context Curation for LLM Catalog Search

QUESTION — Comment coupler la curation de catalogues et le post-entraînement pour améliorer la précision de recherche de produits en contexte long pour les petites entreprises?

La curation de contexte procure des gains allant jusqu'à 31.4 points de pourcentage en précision de recherche.

chuxuan · 01 oct. 2026 lire l'original ↗
15 — evaluation 26 votes

Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows

QUESTION — Comment évaluer des agents de données et des flux de travail analytiques sur des entrepôts de données à l'échelle de l'entreprise qui nécessitent de naviguer dans des schémas complexes et d'exécuter des actions consécutives?

Argo-Bench simule une plateforme de livraison de nourriture à New York avec 81 millions de commandes en 2024.

gtomitsu · 01 oct. 2026 lire l'original ↗
16 — evaluation 24 votes

AutoDataBench: A Data-centric Testbed for Accelerating Auto Research

QUESTION — Comment isoler et évaluer systématiquement la capacité d'un agent IA à comprendre, manipuler et améliorer les données d'entraînement ?

L'article présente AutoDataBench, un banc d'essai contrôlé pour évaluer l'intelligence des données des agents IA. Le cadre se concentre sur le diagnostic, l'organisation et la construction des données à travers trois tâches d'optimisation tout en maintenant les facteurs non liés aux données constants. Il teste la capacité des LLM de pointe à améliorer les données d'entraînement par une experimentation itérative sous des budgets de ressources spécifiques.

gowitheflow · 30 sept. 2026 lire l'original ↗
18 — training 14 votes

The Low-Rank Structure of VLA Reinforcement Learning

QUESTION — Quelles structures de paramètres au sein des modèles vision-langage-action sont responsables des gains de performance lors du post-entraînement par apprentissage par renforcement ?

Le RL induit des mises à jour de paramètres de rang faible concentrées dans les modules Timestep de l'expert en action.

Jongwondd · 28 sept. 2026 lire l'original ↗
19 — training 12 votes

LongLive-Plug: Once-for-All Distillation for Video Generation

QUESTION — Comment réaliser une distillation unique pour des modèles de diffusion vidéo sous forme d'adaptateurs réutilisables sur divers modèles en aval ?

LongLive-Plug apprend des capacités réutilisables sous forme de LoRAs sur un modèle de base pour un déploiement plug-and-play sans entraînement.

Andyson · 29 sept. 2026 lire l'original ↗
20 — evaluation 11 votes

Language Models Are "Insecure" Reporters

QUESTION — Les LLM ont-ils tendance à occulter par défaut les défauts remettant en cause le récit dans les rapports d'expérimentation ?

GPT-5.5 flags the negative result in only 2 of 200 generated reports.

taesiri · 28 sept. 2026 lire l'original ↗
21 — inference 42 votes

Decoding Looped Transformers Better for (Almost) Free

QUESTION — Comment exploiter les états intermédiaires des boucles récurrentes dans les Transformers pour améliorer la qualité du décodage sans entraînement supplémentaire ?

LoopCD-Logits fait passer le pass@1 de AIME 2024 pour Ouro-2.6B-Thinking de 61,88 % à 73,33 %.

neosknight · 01 oct. 2026 lire l'original ↗
24 — agents 43 votes

Architect-Ant: Editable Automatic Furnishing of Architectural Floor Plans

QUESTION — Peut-on apprendre des connaissances professionnelles en matière d'aménagement à partir de véritables plans d'étage à l'aide d'un modèle pré-entraîné, permettant une génération de mise en page directe et consciente des contraintes sans dépendre d'une inférence agentique itérative coûteuse?

AntPlan est un ensemble de données de 505 vrais plans d'étage architecturaux professionnels avec des annotations de mobilier denses couvrant 92 classes d'objets et dix catégories de pièces résidentielles.

OldDelorean · 30 sept. 2026 lire l'original ↗

Sur le terrain

2026-10-03

Dépôts qui montent sur GitHub aujourd'hui, notés sur l'élan du jour, le rang, l'adoption, la fraîcheur et la santé du projet.

01 DietrichGebert/ponytail +1 435 Un cadre d'agent de codage conçu pour écrire un minimum de code, destiné aux développeurs. JavaScript
★ 152 116
02 Panniantong/Agent-Reach +696 Un outil CLI pour collecter des données web et sociales sans frais, parfait pour doter vos agents d'un accès Internet. Python
★ 89 062
03 pbakaus/impeccable +722 Un ensemble de règles de design permettant aux développeurs de guider leurs agents IA dans la création d'interfaces utilisateur soignées. JavaScript
★ 74 512
04 obra/superpowers +556 Une méthodologie de développement et un cadre de compétences pour piloter efficacement les agents de code. Shell
★ 294 584
05 mattpocock/skills +955 Une collection de compétences et de configurations shell pour les ingénieurs optimisant les flux de travail avec des agents de code. Shell
★ 274 882
06 JuliusBrussee/caveman +209 Un proxy de compression de tokens réduisant de 65% le contexte pour agents de code, idéal pour baisser la facture d'inférence. Go
★ 109 222
07 heygen-com/hyperframes +580 Convertit du HTML en vidéo, conçu pour permettre aux agents d'automatiser la génération de contenu. TypeScript
★ 56 016
08 NVIDIA/OpenShell +594 Un runtime sécurisé en Rust pour exécuter des agents autonomes, conçu pour les ingénieurs backend gérant des environnements isolés. Rust
★ 14 531
09 mksglu/context-mode +282 Outil d'optimisation de la fenêtre de contexte pour les agents de codage via MCP et le sandboxing. TypeScript
★ 25 112
10 mvschwarz/openrig +683 Un harnais multi-agents orchestrant Claude Code et Codex, idéal pour les ingénieurs concevant des agents de codage. TypeScript
★ 4 473
11 coreyhaines31/marketingskills +140 Un ensemble de compétences marketing pour Claude Code, destiné aux ingénieurs automatisant l'acquisition et le SEO. JavaScript
★ 52 509
12 colbymchenry/codegraph +98 Un graphe de connaissances de code local qui réduit l'utilisation des jetons pour les agents de codage. C
★ 73 042
13 cursor/plugins +163 La spécification officielle des plugins pour Cursor IDE, conçue pour les développeurs étendant leur environnement de code. TypeScript
★ 9 557
14 Effect-TS/effect +80 Une bibliothèque de programmation fonctionnelle pour TypeScript, conçue pour les ingénieurs backend concevant des systèmes robustes. TypeScript
★ 16 630
15 getsentry/sentry +16 Une plateforme de suivi d'erreurs et de performance de référence, indispensable pour observer les systèmes en production. Python
★ 45 078
16 google/skills +39 Des compétences d'agents standardisées pour l'écosystème Google, destinées aux ingénieurs intégrant des flux LLM. Python
★ 20 831
↑