Cloud Temple

Changelog

Historique des mises à jour et nouveautés de la plateforme

Évolution du catalogue Qwen et MTP activév2.2.0

21/08/2026

Nouveauté
  • Qwen 3.8 27B FP8 rejoint la plateforme.
  • Le modèle qwen3.6:27b FP8 sera déprécié puis redirigé vers qwen3.8:27b FP8 le 30 septembre 2026.
  • Le modèle qwen-coder-next:80b sera redirigé vers qwen3.8:27b FP8 le 30 septembre 2026.
  • Ajout de Qwen 3.5 3B et 9B, deux modèles multimodaux avec une fenêtre de contexte de 250 000 tokens.
  • Le modèle qwen3-vl:235b devient le modèle LTS : évolution plus performante de Qwen 3 235B, il ajoute aussi la prise en charge de la vision et remplace qwen3:235b.
  • Le modèle qwen3-vl:30b est déprécié et sera redirigé vers qwen3.8:27b le 30 septembre 2026.
  • Le modèle qwen3-vl:4b est déprécié et sera redirigé vers qwen3.5:4b le 30 septembre 2026.
  • Le modèle ornith:35b est désormais déprécié : il n’a pas trouvé son utilité ni son public.
  • MTP (Multi-Token Prediction) est désormais actif sur nemotron-3-super:120b, gpt-oss:120b, qwen3.6:27b, qwen3.6:35b, gemma4:31b et mistral-small4:119b.
  • Le modèle devstral-small-2:24b est retiré de la supervision et du cycle de vie ; migrez vers mistral-small4:119b.

Arrivée d'Ornith 35B, spécialiste du coding agentiquev2.1.0

01/07/2026

Nouveauté
  • Nouveau modèle Ornith 1.0 35B (DeepReinforce AI) : architecture Mixture-of-Experts avec 35 milliards de paramètres au total, mais seulement ~3 milliards actifs par token — RL post-entraîné à partir de Qwen 3.5 35B.
  • Spécialisé dans le coding agentique : dépasse même Qwen 3.5 397B sur Terminal-Bench 2.1 (64.2 vs 53.5) malgré une taille près de 10x plus petite, et atteint 75.6% sur SWE-Bench Verified.
  • Fenêtre de contexte de 262 144 tokens, permettant de traiter des dépôts de code volumineux en une seule passe.
  • Licence MIT, entièrement ouverte, sans restriction d'usage commercial.
  • ⚠️ Fin de support planifiée au 30 décembre 2026 (DSP), conformément au cycle de vie standard des modèles récents. Consultez la page Cycle de vie pour les modalités de migration.

Refonte du catalogue : 31 modèles actifs, architecture simplifiéev2.0.0

16/06/2026

Nouveauté
  • Refonte majeure du catalogue de modèles (RFC-0092 + RFC-0094) : 28 modèles actifs en production, répartis en 7 catégories — Génération (17), Embedding (6), Reranking (1), Sécurité (1), Traduction (1), Média (2).
  • Continuité de service garantie : 23 anciens noms de modèles sont redirigés de manière transparente vers leurs successeurs. Vos appels API existants continuent de fonctionner sans modification.
  • Nouveau modèle Gemma 4 12B QAT (Google) : version quantisée optimisée pour l'inférence rapide (42 t/s, contexte 250K tokens).
  • Sécurité renforcée : migration vers Granite 4.1 Guardian 8B (IBM), successeur des modèles Granite 3 Guardian.
  • Performances en hausse : Qwen 3.6 35B atteint 121 t/s, Mistral Small 4 119B atteint 100 t/s, Qwen-Coder-Next 80B atteint 97 t/s.
  • La page Cycle de vie affiche désormais la vitesse (t/s) et les serveurs de chaque modèle pour une transparence complète.

Supervision des modèles Reranker (nouvel onglet)v1.7.0

19/05/2026

Nouveauté
  • Nouvel onglet "Modèles Reranker" dans l'interface, dédié à la supervision des modèles de classement sémantique.
  • Quatre modèles supervisés : qwen3-reranker:4b, bge-reranker-large, qwen3-reranker:0.6b, nemotron-rerank-vl-1b.
  • Le worker teste ces modèles via l'endpoint /v1/rerank (compatible API Cohere) avec une requête type et 4 documents, et mesure la durée totale.

Nouveaux tarifs : Reranking et Batch asynchronev1.8.0

14/05/2026

Nouveauté
  • Nouvelle tarification pour le service de Reranking : 4€ par million de tokens rerankés.
  • Nouvelle tarification pour le mode Batch asynchrone (traitement sous 24h) : 0.9€ par million de tokens en entrée et 4€ par million de tokens en sortie — soit 50% de réduction sur l'input par rapport au tarif synchrone.
  • Le mode Batch permet de soumettre jusqu'à 1000 requêtes en une seule fois, traitées automatiquement pendant les heures creuses (22h-7h + week-ends).

Arrivée de Mistral Small 4 119B et 3 nouveaux Rerankersv1.7.1

13/05/2026

Nouveauté
  • Nouveau modèle Mistral Small 4 (119B paramètres MoE) : vision, sécurité intégrée, contexte de 262K tokens et vitesse élevée (100 t/s). Licence Apache 2.0.
  • Trois nouveaux modèles de Reranking déployés en CPU : Qwen3-Reranker-0.6B (compact), BAAI/bge-reranker-large (haute performance multilingue), Qwen3-Reranker-4B (meilleure compréhension contextuelle).
  • Ces rerankers complètent le pipeline RAG souverain : Embedding → Retrieval → Reranking → Génération, entièrement hébergé en France (SecNumCloud).

Lancement du service de Reranking (API Cohere)v1.7.0

07/05/2026

Nouveauté
  • Nouveau service de Reranking disponible via les endpoints /v1/rerank et /v2/rerank, compatibles avec le SDK Cohere.
  • Premier modèle de reranking : NVIDIA Llama-Nemotron-Rerank-VL-1B-V2. Ordonne une liste de documents par pertinence vis-à-vis d'une requête.
  • Idéal en complément de la pile RAG (Embedding + Retrieval + Rerank) pour améliorer significativement la précision des résultats de recherche sémantique.
  • Hébergé intégralement en France, infrastructure qualifiée SecNumCloud.

Arrivée de Qwen 3.6 35Bv1.6.0

22/04/2026

Nouveauté
  • Nouveau modèle Mixture-of-Experts d'Alibaba : 35 milliards de paramètres au total, mais seulement 3 milliards actifs par token, offrant des performances de pointe avec une efficacité d'inférence remarquable.
  • Spécialisé dans le coding agentique : raisonnement à l'échelle d'un dépôt complet, function calling natif et maintien du contexte de raisonnement sur les workflows étendus.
  • Fenêtre de contexte d'un million de tokens, permettant d'ingérer des projets entiers en une seule passe.
  • Benchmarks de référence : 73.4% SWE-bench Verified, 92.7% AIME26, 86.0% GPQA, 85.2% MMLU-Pro — progression significative par rapport à Qwen 3.5 (+3.4 SWE-bench, +11 Terminal-Bench).
  • Licence Apache 2.0. Environ 9× moins de compute par token que Gemma 4 31B pour des performances comparables.

Arrivée de Gemma 4 31Bv1.5.0

16/04/2026

Nouveauté
  • Nouveau modèle dense multimodal de 31 milliards de paramètres par Google DeepMind, classé #3 mondial parmi les modèles ouverts (Arena AI).
  • Entrées multimodales : texte, image et vidéo (jusqu'à 60 secondes). Supporte plus de 140 langues.
  • Fenêtre de contexte de 256K tokens avec mécanisme d'attention hybride (locale glissante + globale).
  • Capacités agentiques avancées : function calling natif, raisonnement chaîné (chain-of-thought), génération de JSON structuré.
  • Benchmarks de référence : 89.2% AIME 2026, 85.2% MMLU Pro, 80.0% LiveCodeBench v6, 84.3% GPQA Diamond.

Historique enfin utilisable et nettoyage automatiquev1.4.0

13/04/2026

Amélioration
  • La page d'historique est désormais rapide et fluide, même sur des périodes de 30 ou 90 jours.
  • Les graphiques s'adaptent automatiquement à la période sélectionnée : données détaillées sur 24h, moyennes horaires sur 7 jours, moyennes journalières sur 30+ jours.
  • Nouvelle barre de recherche pour trouver un modèle rapidement, avec filtres par statut (opérationnels / dégradés).
  • Les anciennes données sont nettoyées automatiquement (conservation de 90 jours par défaut).

Mise à jour du catalogue de modèles et nouvel onglet Guardian

01/04/2026

Nouveauté
  • Ajout de 8 nouveaux modèles texte : nemotron-3-super:120b, nemotron-cascade:30b, qwen-coder-next:80b, qwen3.5:0.8b, qwen3.5:4b, qwen3.5:9b, qwen3.5:27b, qwen3.5:35b.
  • Nouvel onglet Modèles Guardian : supervision des modèles de sécurité granite3-guardian:2b et guardian:8b (guardrail/safety).
  • Total des modèles supervisés : 44 Chat/Vision, 6 Embedding, 2 Voix, 1 Image, 2 Guardian.
  • Nous sommes ravis d'accueillir les premiers modèles à 1 million de tokens de contexte : nemotron-3-super:120b, nemotron-cascade:30b et qwen3.5:27b.
  • Retrait du cycle de vie de 7 modèles en fin de support (DSP 30/03/2026) : devstral:24b, granite3.1-moe:2b, granite4-small-h:32b, granite4-tiny-h:7b, medgemma:27b, qwen3-coder:30b, qwen3:30b-a3b.

Supervision des modèles Voix et Image

26/03/2026

Nouveauté
  • Ajout de deux nouveaux onglets "Voix" et "Image" sur la page de statut pour une meilleure classification.
  • Support du monitoring d'images via le modèle de génération `x/z-image-turbo:latest`.
  • Support du monitoring de transcription vocale via le modèle `mlx-community/whisper-large-v3-mlx`.
  • Support du monitoring temps réel (WebSocket) pour le modèle vocal `voxtral`.

Nouvelle page Cycle de vie des modèles

21/02/2026

Nouveauté
  • Nouvelle page /lifecycle : Tableau interactif présentant le cycle de vie complet des 42 modèles LLMaaS en production.
  • Informations clés : Date de mise en production (DMP), date de sortie de production (DSP), statut LTS, migration conseillée et taille de contexte (num_ctx).
  • Indicateurs visuels : Barre de progression colorée (vert → jaune → orange → rouge) montrant le pourcentage de vie écoulé, badges DSP avec jours restants, badges LTS.
  • Filtrage avancé : Onglets (Tous / LTS uniquement / Fin de support < 6 mois), recherche textuelle, et tri par colonnes (modèle, DMP, DSP, contexte).
  • Cartes statistiques : Vue d'ensemble avec le nombre total de modèles, les modèles LTS, ceux en fin de support proche, et ceux avec migration conseillée.
  • Légende explicative : Description des indicateurs DMP, DSP, LTS et num_ctx pour faciliter la compréhension.
  • Accessible depuis un nouveau bouton sur la page d'accueil, entre Historique et Changelog.

Arrivée de Qwen3-Coder-Next

05/02/2026

Nouveauté
  • Qwen3-Coder-Next : Un modèle ouvert conçu spécifiquement pour les agents de codage et le développement local.
  • Efficacité & Performance : Seulement 3B paramètres activés (sur 80B totaux), rivalisant avec des modèles 10-20x plus gros.
  • Capacités Agentiques : Excellence dans le raisonnement à long terme, l'utilisation d'outils complexes et la récupération après échec.
  • Intégration IDE : Fenêtre de contexte de 256k tokens, compatible avec les plateformes modernes (Claude Code, Cline, etc.).

Améliorations de la Plateforme et du Suivi

03/02/2026

Nouveauté
  • Nouveaux Modèles : Upgrade de GLM-4.7-Flash 30B à plus de 100 tokens/s et arrivée de Devstral Small 2 24b.
  • Performance : Augmentation de la puissance de calcul pour GPT-OSS 120B et stabilisation de Qwen Next 80B (dernière version).
  • Tarification Simplifiée : Nouvelle grille tarifaire unifiée (même tarif pour le raisonnement).
  • Page de Statut : Nouvelle organisation par onglets (Chat vs Embedding) pour une meilleure lisibilité.

Arrivée de TranslateGemma

22/01/2026

Nouveauté
  • Nouvelle collection de modèles de traduction ouverts construits sur Gemma 3.
  • Disponibilité : Tailles 4B, 12B et 27B pour répondre à différents besoins de performance.
  • Couverture multilingue : Support complet pour 55 langues, permettant une communication fluide indépendamment de la localisation ou du type d'appareil.
  • Capacités avancées de traduction : Préservation fidèle du sens, des nuances et des sensibilités culturelles entre les langues.

Ajout du modèle GLM-4.7-Flash

22/01/2026

Nouveauté
  • Configuration complète du modèle GLM-4.7-Flash 30B intégrée.
  • Performances : 56 tokens/s avec consommation énergétique optimisée à 2,38 kWh/Mtoken.
  • Fenêtre de contexte : 200 000 tokens pour le traitement de documents volumineux.

Disponibilité des Modèles d'Embedding

07/01/2026

Nouveauté
  • Disponibilité immédiate de nouveaux modèles d'embedding haute performance.
  • granite-embedding:278m (Latence moyenne ~286 ms)
  • embeddinggemma:300m (Latence moyenne ~330 ms)
  • bge-m3:567m (Latence moyenne ~561 ms)
  • qwen3-embedding:0.6b (Latence moyenne ~712 ms)

Arrivée de Qwen 3 235B

04/01/2026

Nouveauté
  • Nouveau modèle massivement parallèle (MoE) pour le raisonnement complexe.
  • Capacités avancées en mathématiques et logique avec une très grande base de connaissances.
  • Performance : Fenêtre de contexte de 128k tokens.

Arrivée de Qwen 3 VL 235B

04/01/2026

Nouveauté
  • Analyse multimodale de très haut niveau combinant vision et texte.
  • Excellence en OCR complexe sur des documents volumineux.
  • Performance : Fenêtre de contexte massive de 200k tokens.

Arrivée de Nemotron-3 Nano

04/01/2026

Nouveauté
  • Modèle spécialisé dans le raisonnement pur et le "function calling".
  • Haute efficacité pour les agents autonomes.
  • Performance : Fenêtre de contexte de 250k tokens.

Arrivée de Qwen 3 VL

30/12/2025

Nouveauté
  • Disponibilité immédiate de la gamme Qwen 3 Vision-Language : 2B, 4B, 8B, 30B et 32B.
  • Performance : Tous les modèles offrent une fenêtre de contexte de 250k tokens.
  • Cycle de vie : Ces modèles bénéficieront d'un support garanti jusqu'au 30 juin 2026.

Nouveaux Modèles d'Embedding

30/12/2025

Nouveauté
  • Disponibilité des modèles d'embedding Qwen 3 : 4B et 8B.
  • Cycle de vie : Support garanti jusqu'au 30 décembre 2026.

Arrivée de Function Gemma

30/12/2025

Nouveauté
  • Disponibilité du modèle spécialisé Function Calling : Function Gemma 270M.
  • Performance : Fenêtre de contexte de 32k tokens.
  • Cycle de vie : Support garanti jusqu'au 30 décembre 2026.

Arrivée de Olmo 3

30/12/2025

Nouveauté
  • Disponibilité des modèles Olmo 3 (Open Language Model) : 7B et 32B.
  • Performance : Fenêtre de contexte de 64k tokens.
  • Cycle de vie : Support garanti jusqu'au 30 juin 2026.

Arrivée de Ministral 3

30/12/2025

Nouveauté
  • Disponibilité des modèles Ministral 3 (Mistral AI) : 3B, 8B et 14B.
  • Performance : Fenêtre de contexte de 250k tokens.
  • Cycle de vie : Support garanti jusqu'au 30 juin 2026.

Arrivée de Devstral Small 2

30/12/2025

Nouveauté
  • Disponibilité du modèle Devstral Small 2 (Mistral AI) : 24B.
  • Performance : Fenêtre de contexte massive de 380k tokens.
  • Cycle de vie : Support garanti jusqu'au 30 juin 2026.

Arrivée de RNJ-1

30/12/2025

Nouveauté
  • Disponibilité du modèle RNJ-1 : 8B.
  • Performance : Fenêtre de contexte de 32k tokens.
  • Cycle de vie : Support garanti jusqu'au 30 juin 2026.

Dépréciation de modèles

30/12/2025

Maintenance
  • Les modèles suivants ont été retirés des serveurs :
  • DeepSeek R1 (14b, 32b), Gemma 3 (1b, 4b), Qwen 3 (0.6b, 1.7b, 4b, 8b, 14b, 32b, 30b-a3b*), QwQ 32b, Granite 3.3 (2b, 8b), Mistral Small 3.1 24b, Qwen 2.5 VL (3b, 7b, 32b, 72b), Cogito (3b, 8b), DeepCoder 14b.
  • * qwen3:30b-a3b est redirigé vers qwen3-2507:30b-a3b.

Nouveaux Modèles : Devstral & DeepSeek-OCR

23/11/2025

Nouveauté
  • Devstral small 2507 24B (Mistral AI) : Optimisé en FP8 avec 120k tokens de contexte, idéal pour l'analyse de code et les tâches agentiques.
  • DeepSeek-OCR : Numérisation haute précision, convertissant tableaux complexes et formules mathématiques en Markdown structuré.

Support DeepSeek OCR

22/11/2025

Nouveauté
  • Nouvelle capacité OCR : Intégration du modèle DeepSeek pour une reconnaissance de texte avancée.
  • Traitement optimisé des documents et images avec une haute précision.

API de Supervision Publique

21/11/2025

Nouveauté
  • Lancement de l'API de statut (/api/platform-status) : Permet aux développeurs et administrateurs d'intégrer l'état de santé de la plateforme LLMaaS dans leurs propres outils de monitoring.
  • Accès aux métriques globales et détaillées par modèle en temps réel.

Performance et Cycle de Vie des Modèles

21/11/2025

Maintenance
  • Dépréciation : Les modèles Gemma 3 12B et Qwen 3 235B sont retirés du catalogue actif.
  • Alertes de Fin de Vie (31 Décembre 2025) : DeepSeek R1 (14B, 32B), Granite 3.3 & Vision (vers Granite 4), Qwen 2.5 VL (vers Qwen 3 VL), Mistral Small 3.1 (remplacé par 3.2).
  • Prolongation : Support étendu pour Gemma 3 27B jusqu'au 30 Mars 2026.
  • Performances : Mise à jour des indicateurs de vitesse et consommation énergétique suite aux optimisations d'infrastructure.

Synthèse Vocale (Text-to-Speech)

20/11/2025

Nouveauté
  • Lancement de la Synthèse Vocale : Nouveau service de génération audio (TTS) fluide et naturel.
  • Nouveau modèle de facturation : Tarification à la seconde pour le service audio, adaptée à l'usage réel.

Réactivité Accrue

16/11/2025

Amélioration
  • Suppression des temps de chargement : Optimisation des ressources pour maintenir les modèles critiques en mémoire.
  • Élimination du "cold start" pour une réponse immédiate aux requêtes.

Arrivée de Qwen Next

14/11/2025

Nouveauté
  • Qwen Next 80B : Introduction de la nouvelle génération offrant des capacités de raisonnement et de codage supérieures.
  • Remplacement des versions expérimentales précédentes.

Stabilité et Sécurité

12/11/2025

Amélioration
  • Renforcement de l'infrastructure : Amélioration de la gestion des pics de charge.
  • Sécurité renforcée des accès API pour garantir une meilleure disponibilité globale.