Les deux entreprises chinoises poursuivent leurs travaux pour tailler dans les coûts de l’inférence tout en proposant des modèles capables de rivaliser avec ceux d’Anthropic et d’OpenAI. Pour les entreprises occidentales, Qwen-3.8 Flash Next semble le plus intéressant en matière d’inférence locale.
Actualités
GLM-5.3 Flash, Qwen-3.8 Flash Next : zAI et Alibaba cherchent à casser les prix de l’inférence IA