Articles et papiers, lus depuis leur résumé, classés par pertinence pour qui construit des agents et du backend.
01 — inference
171 votes
QUESTION — Comment réduire considérablement les coûts de calcul du pré-remplissage et l'empreinte massive du cache KV pour les agents à long horizon ?
DeepSeek-V4.1-Flash est un modèle MoE multimodal avec 552B paramètres de base et une prise en charge de contextes allant jusqu'à un million de tokens.
02 — agents
78 votes
QUESTION — Comment les agents numériques peuvent-ils s'améliorer de manière récursive et autonome dans de nouveaux environnements sans mettre à jour les paramètres du modèle ?
RSIAgent est un framework multi-agent sans entraînement permettant l'auto-amélioration récursive par construction de mémoire autonome.
03 — agents
75 votes
QUESTION — Comment les composants individuels du harness tels que la gestion du contexte, la planification et l'espace d'action impactent-ils les performances des agents de code ?
La gestion du contexte prévient les pannes de dépassement et devient plus précieuse lorsque le budget de la fenêtre de contexte est restreint.
04 — agents
69 votes
QUESTION — Comment les modèles de langage peuvent-ils estimer la confiance de manière plus fiable en s'appuyant sur l'expérience passée plutôt que sur le processus d'inférence actuel ?
XConf égale ou surpasse la cohérence interne à dix échantillons en termes de discrimination (AUROC) sur 23 comparaisons sur 24.
05 — agents
414 votes
QUESTION — Comment les agents de fondation peuvent-ils être entraînés et intégrés efficacement dans les flux de travail de recherche et d'ingénierie réels ?
Atria Dawn Preview obtient le score le plus élevé rapporté sur cinq des 16 benchmarks.
06 — agents
208 votes
QUESTION — Comment rendre l'auto-amélioration récursive des harnais d'agents généralisable sans surajustement aux benchmarks d'évaluation ni confusion des détails de tâches ?
ModularRSI sélectionne 2 000 tâches d'évolution exécutables provenant de sources externes, dissociées des benchmarks d'évaluation en aval.
07 — agents
102 votes
QUESTION — Comment mettre à l'échelle de manière récursive les boucles de recherche automatique au niveau du harness pour optimiser l'utilisation des jetons et les coûts des agents de codage ?
Quatre mécanismes forment SoL-Pi, couvrant l'exécution des actions, la compression du contexte, la gestion des observations et la lecture déléguée.
08 — system_design
97 votes
QUESTION — Comment les dépôts de code scientifique mondiaux peuvent-ils être convertis en environnements programmables pour former des agents scientifiques ?
ScienceIDE transforme les dépôts de code scientifique en environnements programmables prenant en charge la génération, l'exécution et la vérification.
09 — agents
61 votes
QUESTION — Comment évaluer les agents de codage sur des fonctionnalités de développement web découvertes grâce à l'interaction avec des applications de référence ?
Le pipeline mine-craft-patch découvre 1 975 comportements vérifiés sur 26 applications et construit 4 063 tâches automatiquement.
10 — training
55 votes
QUESTION — Comment les agents multi-tours peuvent-ils être entraînés par apprentissage par renforcement tout en évitant l'instabilité liée aux informations privilégiées du professeur?
RetireOPD adopte la retraite adaptative où l'étudiant abandonne le professeur une fois que l'écart cesse de diminuer et atteint un taux de réussite cible.
11 — agents
44 votes
QUESTION — Comment les agents GUI peuvent-ils faire évoluer dynamiquement leurs compétences exécutables à partir des retours de déploiement sans nécessiter d'entraînement supplémentaire du modèle ?
EvoSkill-GUI atteint des gains maximaux de +16.2%, +6.0% et +10.5% sur les benchmarks MobileWorld, AndroidWorld et OSWorld respectivement.
12 — agents
32 votes
QUESTION — Comment faire passer les fondation models de la résolution de problèmes spécifiés par l'humain à la découverte ouverte et à la construction de connaissances ?
Un DFM opère sur un état de recherche révisable et prend en charge sept capacités couplées allant de la découverte de problèmes à l'amélioration continue.
13 — agents
30 votes
QUESTION — Comment les agents d'IA scientifique peuvent-ils co-évoluer continuellement leurs harnais et leurs poids de modèle grâce à une boucle d'auto-amélioration récursive ?
ScienceBuddy associe l'évolution du harnais à l'apprentissage par renforcement du modèle via un paradigme d'auto-amélioration récursive dans la récursive.
14 — inference
76 votes
QUESTION — Comment réduire l'empreinte mémoire et le trafic de lecture du cache KV lors du décodage des Transformers sans sacrifier la précision ?
Grouped Value Attention (GVA) stocke des valeurs groupées et reconstruit les clés de contenu à l'aide d'une application linéaire apprise.
15 — multimodal
55 votes
QUESTION — Comment unifier et stabiliser la génération vidéo multimodale native pour les flux de travail visuels des agents tout en garantissant des performances en temps réel ?
LynnReal-Omni s'appuie sur un transformateur de diffusion multimodale partagé de 32B et une variante Flash de 27B pour le rendu en temps réel.
16 — agents
38 votes
QUESTION — Comment les agents de trading basés sur des LLM peuvent-ils faire évoluer automatiquement leurs politiques d'utilisation des outils grâce aux retours d'exécution sans modifier le modèle de base ?
EvolveTrade améliore le ratio de Sharpe et le rendement cumulé par rapport aux références LLM à politique fixe dans la plupart des contextes évalués.
17 — training
347 votes
QUESTION — Comment surmonter l'oubli catastrophique pour parvenir à une mémorisation à long terme sur de nombreuses mises à jour séquentielles ?
La méthode combinant les trois ancres avec un LoRA fusionné fait passer la rétention finale moyenne de 1,2 % sous fine-tuning séquentiel naïf à 34,9 %, soit une amélioration de 28 fois.
18 — architecture
253 votes
QUESTION — Comment un modèle de fondation compact peut-il surmonter les limites de capacité paramétrique en associant la réflexion interne à l'utilisation d'outils externes ?
La conception du pré-entraînement offre une amélioration d'efficacité d'environ 4,2x du temps de pré-entraînement par rapport à la perte à 16K.
19 — multimodal
170 votes
QUESTION — Comment transformer un modèle vision-langage en un modèle de fondation physique unifié capable de comprendre l'environnement et de générer des actions ?
Notre modèle de 8B atteint un score moyen de 72,5 sur 28 benchmarks de compréhension incarnée.
20 — multimodal
127 votes
QUESTION — Comment concilier des capacités de raisonnement approfondi et une faible latence dans les systèmes d'interaction vocale en temps réel ?
En mode raisonnement, StepAudio 3 atteint une moyenne macro de 73,0 sur StepAudioChat.
21 — training
107 votes
QUESTION — Quelles sont les causes de l'inflation de la longueur dans la distillation en politique (on-policy distillation) et comment résoudre les incompatibilités de jetons de fin ?
L'incompatibilité des jetons de fin entre étudiants de base et enseignants post-entraînés est une source importante d'inflation de la longueur.
22 — training
75 votes
QUESTION — Quel est le mode de défaillance systématique connu sous le nom de Value Flattening dans les critiques PPO lors de l'apprentissage par renforcement des LLM, et comment l'atténuer ?
Le Value Flattening est un mode de défaillance où les valeurs d'état changent brusquement tandis que les prédictions du critique restent plates.
23 — architecture
69 votes
QUESTION — Un principe d'apprentissage commun peut-il prendre en charge la modélisation du monde à travers des systèmes radicalement différents ?
JEPA-Anything améliore les métriques rapportées sur l'ensemble des 10 tâches de dynamique par rapport aux références JEPA.
24 — system_design
52 votes
QUESTION — Làm thế nào để quản lý bộ nhớ chia sẻ dựa trên Git nhằm phối hợp hiệu quả nhiều AI agent tự động nghiên cứu mà không bị trùng lặp công sức?
Các worker đã xuất bản 1.703 đóng góp và cải thiện đánh giá từ 3,39 xuống 1,899 bits per byte.
Rien dans cette rubrique.