chore(ai): ajout nouveaux modèles
This commit is contained in:
@@ -61,6 +61,50 @@ let
|
|||||||
contextWindow = 262144;
|
contextWindow = 262144;
|
||||||
maxTokens = 64000;
|
maxTokens = 64000;
|
||||||
}
|
}
|
||||||
|
{
|
||||||
|
id = "qwen3.8-27b";
|
||||||
|
name = "Qwen 3.8 27B (vision) — Lundi Matin";
|
||||||
|
# reasoning = false : avec thinking.enabled la passerelle/vLLM supprime
|
||||||
|
# le bloc thinking (testé), donc on laisse pi ne pas envoyer le
|
||||||
|
# paramètre thinking. qwen raisonne alors nativement et emet des
|
||||||
|
# blocs thinking a signature vide (deja gere par
|
||||||
|
# compat.allowEmptySignature du provider).
|
||||||
|
reasoning = false;
|
||||||
|
# Modele vision : accepte les images (teste via l'endpoint anthropic
|
||||||
|
# /v1/messages, format image.source.base64). Reserve aux analyses
|
||||||
|
# d'image : basculer dessus via /model pour cet usage, ou via
|
||||||
|
# l'extension vision-proxy pour un routage automatique.
|
||||||
|
input = [
|
||||||
|
"text"
|
||||||
|
"image"
|
||||||
|
];
|
||||||
|
# Limite reelle mesuree via la passerelle LiteLLM (HTTP 400 :
|
||||||
|
# "This model's maximum context length is 250000 tokens").
|
||||||
|
contextWindow = 250000;
|
||||||
|
maxTokens = 64000;
|
||||||
|
}
|
||||||
|
{
|
||||||
|
id = "qwen3.8-flash-next";
|
||||||
|
name = "Qwen 3.8 Flash Next (vision) — Lundi Matin";
|
||||||
|
# Meme logique que qwen3.8-27b : thinking.enabled supprime le bloc
|
||||||
|
# thinking cote vLLM (teste), donc on laisse pi ne pas envoyer le
|
||||||
|
# parametre thinking. Le modele raisonne alors nativement et emet
|
||||||
|
# des blocs thinking a signature vide, deja geres par
|
||||||
|
# compat.allowEmptySignature du provider.
|
||||||
|
reasoning = false;
|
||||||
|
# Modele vision : 125B-A5B MoE multimodal (plus rapide et plus
|
||||||
|
# puissant que deepseek-v4-flash, qui reste 284B-A13B non multimodal).
|
||||||
|
# Bémol : contexte plafonne a 262k, comme deepseek-v4-flash, contre
|
||||||
|
# 500k pour glm-5.2 et kimi-k3.
|
||||||
|
input = [
|
||||||
|
"text"
|
||||||
|
"image"
|
||||||
|
];
|
||||||
|
# Limite reelle mesuree via la passerelle LiteLLM (HTTP 400
|
||||||
|
# ContextWindowExceededError a 262145 tokens).
|
||||||
|
contextWindow = 262144;
|
||||||
|
maxTokens = 64000;
|
||||||
|
}
|
||||||
];
|
];
|
||||||
};
|
};
|
||||||
};
|
};
|
||||||
|
|||||||
Reference in New Issue
Block a user