LLM Control Plane v2.71
Unified OpenAI proxy + MCP agent broker + vLLM administration

Generation Presets

Saved sampling policy. When a preset is enabled and assigned, the proxy enforces its defined fields upstream. Presets are never assigned to model profiles automatically.

When speculative-decoding safe is enabled on a preset, the proxy explicitly sends min_p=0 and removes logit_bias immediately before forwarding upstream. Preset assignment remains entirely manual.

Preset Inventory

PresetDefaultEnabledSpec-safeSamplingNotes
Deterministic Coding
deterministic_coding
FalseTrueFalsetemperature=0.15 top_p=0.9 top_k=40 min_p=0.03 repetition_penalty=1.05 seed=nullLow-variance coding and patching.
Balanced Coding
balanced_coding
FalseTrueFalsetemperature=0.65 top_p=0.9 top_k=50 min_p=0.05 repetition_penalty=1.05 seed=nullDefault profile for Zoo/local coding: varied but controlled.
General Assistant
general_assistant
FalseTrueFalsetemperature=0.75 top_p=0.92 top_k=60 min_p=0.03 repetition_penalty=1.04 seed=nullGeneral chat/default assistant work.
Creative Brainstorming
creative_brainstorming
FalseTrueFalsetemperature=1 top_p=0.95 top_k=100 min_p=0.02 repetition_penalty=1.02 seed=nullHigher variance idea generation.
Tool Call Safe
tool_call_safe
FalseTrueFalsetemperature=0.2 top_p=0.85 top_k=40 min_p=0.03 repetition_penalty=1.05 seed=nullConservative output for tool-call-heavy work.
DeepSeek Speculative
deepseek_speculative
FalseTrueFalsetemperature=0.65 top_p=0.9 top_k=50 min_p= repetition_penalty=1.05 seed=nullDeepSeek V4 DSpark speculative decoding; min_p omitted.
GLM 5.3 Flash Speculative
glm_5_3_flash_speculative
TrueTrueTruetemperature=1 top_p=0.95 top_k= min_p=0 repetition_penalty= seed=nullGLM 5.3 Flash speculative/MTP compatibility preset. Uses GLM temperature=1.0 and top_p=0.95 defaults; forces min_p=0 and strips logit_bias before upstream forwarding.