# SPDX-License-Identifier: Apache-2.0 # SPDX-FileCopyrightText: Copyright contributors to the vLLM project from collections.abc import Iterable from itertools import islice import torch from torch import nn from transformers import CohereConfig from vllm.compilation.decorators import support_torch_compile from vllm.config import CacheConfig, VllmConfig from vllm.distributed import ( get_pp_group, get_tensor_model_parallel_world_size, ) from vllm.model_executor.layers.activation import SiluAndMul from vllm.model_executor.layers.attention import Attention from vllm.model_executor.layers.fused_moe import ( FusedMoE, ) from vllm.model_executor.layers.linear import ( MergedColumnParallelLinear, QKVParallelLinear, ReplicatedLinear, RowParallelLinear, ) from vllm.model_executor.layers.logits_processor import LogitsProcessor from vllm.model_executor.layers.quantization import QuantizationConfig from vllm.model_executor.layers.rotary_embedding import get_rope from vllm.model_executor.layers.vocab_parallel_embedding import VocabParallelEmbedding from vllm.model_executor.model_loader.weight_utils import ( row_parallel_weight_loader, ) from vllm.model_executor.utils import set_weight_attrs from vllm.platforms import current_platform from vllm.sequence import IntermediateTensors from .commandr import LayerNorm from .interfaces import SupportsPP, SupportsQuant from .utils import ( AutoWeightsLoader, WeightsMapper, extract_layer_index, make_empty_intermediate_tensors_factory, make_layers, maybe_prefix, ) def is_prefix_dense_layer(config: CohereConfig, layer_idx: int) -> bool: """True when layer_idx lies in the contiguous dense MLP prefix.""" if layer_idx >= len(config.mlp_layer_types): return False return all(t == "dense" for t in config.mlp_layer_types[: layer_idx + 1]) @torch.compile(backend=current_platform.simple_compile_backend) def token_choice_with_bias( hidden_states: torch.Tensor, gating_output: torch.Tensor, topk: int, renormalize: bool, ): """Sigmoid -> top-k (-> renormalize) custom routing for Cohere2Moe.""" assert hidden_states.shape[0] == gating_output.shape[0], "Number of tokens mismatch" scores = gating_output.float().sigmoid() topk_weights, topk_ids = torch.topk(scores, k=topk, dim=-1, sorted=False) if renormalize: topk_weights = topk_weights / topk_weights.sum(dim=-1, keepdim=True) return topk_weights.to(torch.float32), topk_ids.to(torch.int32) @torch.compile(backend=current_platform.simple_compile_backend) def rms_norm_func(hidden_states, weight, variance_epsilon): input_dtype = hidden_states.dtype hidden_states = hidden_states.to(torch.float32) variance = hidden_states.pow(2).mean(-1, keepdim=True) hidden_states = hidden_states * torch.rsqrt(variance + variance_epsilon) hidden_states = weight.to(torch.float32) * hidden_states return hidden_states.to(input_dtype) class RMSNorm(nn.Module): def __init__(self, param_shape=None, eps=1e-6): super().__init__() self.weight = nn.Parameter(torch.ones(param_shape)) self.variance_epsilon = eps set_weight_attrs(self.weight, {"weight_loader": row_parallel_weight_loader}) def forward(self, hidden_states, residuals=None): hidden_states = rms_norm_func(hidden_states, self.weight, self.variance_epsilon) return hidden_states, residuals def select_norm_impl(config: CohereConfig) -> tuple[type[nn.Module], float]: """Returns (norm_class, eps). Uses RMSNorm when config.rms_norm_eps is set, otherwise falls back to LayerNorm with config.layer_norm_eps.""" rms_eps = getattr(config, "rms_norm_eps", None) if rms_eps is not None: return RMSNorm, rms_eps return LayerNorm, config.layer_norm_eps class Cohere2MoeMLP(nn.Module): """Cohere MLP used as shared experts in the MoE block.""" def __init__( self, config: CohereConfig, intermediate_size: int | None = None, quant_config: QuantizationConfig | None = None, reduce_results: bool = False, prefix: str = "", ): super().__init__() self.config = config self.hidden_size = config.hidden_size self.intermediate_size = ( intermediate_size if intermediate_size is not None else config.intermediate_size ) self.gate_up_proj = MergedColumnParallelLinear( self.hidden_size, [self.intermediate_size] * 2, bias=False, quant_config=quant_config, prefix=f"{prefix}.gate_up_proj", ) self.down_proj = RowParallelLinear( self.intermediate_size, self.hidden_size, bias=False, quant_config=quant_config, reduce_results=reduce_results, prefix=f"{prefix}.down_proj", ) self.act_fn = SiluAndMul() def forward(self, x): gate_up, _ = self.gate_up_proj(x) x = self.act_fn(gate_up) x, _ = self.down_proj(x) return x class Cohere2MoeAttention(nn.Module): """Cohere MoE attention with sliding-window interleave.""" def __init__( self, config: CohereConfig, cache_config: CacheConfig | None = None, quant_config: QuantizationConfig | None = None, prefix: str = "", ): super().__init__() tp_size = get_tensor_model_parallel_world_size() self.config = config self.layer_idx = extract_layer_index(prefix) self.hidden_size = config.hidden_size self.total_num_heads = config.num_attention_heads self.num_heads = self.total_num_heads // tp_size self.head_dim = getattr( config, "head_dim", self.hidden_size // self.total_num_heads ) self.total_num_kv_heads = config.num_key_value_heads if self.total_num_kv_heads >= tp_size: assert self.total_num_kv_heads % tp_size == 0 else: assert tp_size % self.total_num_kv_heads == 0 self.num_kv_heads = max(1, self.total_num_kv_heads // tp_size) self.q_size = self.num_heads * self.head_dim self.kv_size = self.num_kv_heads * self.head_dim self.scaling = self.head_dim**-0.5 self.max_position_embeddings = getattr( config, "model_max_length", None ) or getattr(config, "max_position_embeddings", 8192) self.qkv_proj = QKVParallelLinear( self.hidden_size, self.head_dim, self.total_num_heads, self.total_num_kv_heads, bias=False, quant_config=quant_config, prefix=f"{prefix}.qkv_proj", ) self.o_proj = RowParallelLinear( self.total_num_heads * self.head_dim, self.hidden_size, bias=False, quant_config=quant_config, prefix=f"{prefix}.o_proj", ) self.rotary_emb = get_rope( self.head_dim, max_position=self.max_position_embeddings, rope_parameters=config.rope_parameters, is_neox_style=False, ) self.sliding_window = None layer_types = getattr(config, "layer_types", None) if ( layer_types is not None and layer_types[self.layer_idx] == "sliding_attention" ): self.sliding_window = config.sliding_window # Prefix-dense layers have full attention (no sliding window). When # prefix_dense_sliding_window_pattern == 1, they keep RoPE even though # they are not sliding-window layers. prefix_dense_sliding_window_pattern = getattr( config, "prefix_dense_sliding_window_pattern", 1 ) self.force_rope = bool( is_prefix_dense_layer(config, self.layer_idx) and prefix_dense_sliding_window_pattern == 1 ) self.attn = Attention( self.num_heads, self.head_dim, self.scaling, num_kv_heads=self.num_kv_heads, cache_config=cache_config, quant_config=quant_config, per_layer_sliding_window=self.sliding_window, prefix=f"{prefix}.attn", ) def forward( self, positions: torch.Tensor, hidden_states: torch.Tensor, ) -> torch.Tensor: qkv, _ = self.qkv_proj(hidden_states) q, k, v = qkv.split([self.q_size, self.kv_size, self.kv_size], dim=-1) if self.sliding_window or self.force_rope: q, k = self.rotary_emb(positions, q, k) attn_output = self.attn(q, k, v) output, _ = self.o_proj(attn_output) return output class Cohere2Moe(nn.Module): """Tensor-parallel MoE block for Cohere2Moe with shared experts.""" def __init__( self, config: CohereConfig, params_dtype: torch.dtype | None = None, quant_config: QuantizationConfig | None = None, tp_size: int | None = None, prefix: str = "", ): super().__init__() self.hidden_size = config.hidden_size self.tp_size = get_tensor_model_parallel_world_size() if self.tp_size > config.num_experts: raise ValueError( f"Tensor parallel size {self.tp_size} is greater than " f"the number of experts {config.num_experts}." ) if ( hasattr(config, "expert_selection_fn") and config.expert_selection_fn == "sigmoid" ): self.custom_routing_function = token_choice_with_bias else: self.custom_routing_function = None self.gate = ReplicatedLinear( config.hidden_size, config.num_experts, bias=False, params_dtype=params_dtype, quant_config=None, prefix=f"{prefix}.gate", ) if hasattr(config, "num_shared_experts") and config.num_shared_experts > 0: self.shared_experts = Cohere2MoeMLP( config=config, intermediate_size=config.intermediate_size * config.num_shared_experts, quant_config=quant_config, prefix=f"{prefix}.shared_experts", ) self.shared_expert_combination_strategy = getattr( config, "shared_expert_combination_strategy", "sum" ) assert self.shared_expert_combination_strategy in ("average", "sum"), ( "shared_expert_combination_strategy must be one of ['average', 'sum']" ) else: self.shared_experts = None self.shared_expert_combination_strategy = None self.experts = FusedMoE( num_experts=config.num_experts, top_k=config.num_experts_per_tok, hidden_size=config.hidden_size, intermediate_size=config.intermediate_size, params_dtype=params_dtype, renormalize=getattr(config, "norm_topk_prob", True), quant_config=quant_config, tp_size=tp_size, prefix=f"{prefix}.experts", custom_routing_function=self.custom_routing_function, shared_experts=self.shared_experts, ) def forward(self, hidden_states: torch.Tensor) -> torch.Tensor: orig_shape = hidden_states.shape hidden_states = hidden_states.view(-1, self.hidden_size) router_logits, _ = self.gate(hidden_states) # FusedMoE handles shared expert overlap internally and returns # shared_output + routed_output when shared_experts is set. final_hidden_states = self.experts(hidden_states, router_logits) if self.shared_expert_combination_strategy == "average": final_hidden_states = final_hidden_states / 2 return final_hidden_states.view(orig_shape) class Cohere2MoeDecoderLayer(nn.Module): def __init__( self, config: CohereConfig, cache_config: CacheConfig | None = None, quant_config: QuantizationConfig | None = None, prefix: str = "", ): super().__init__() self.config = config self.hidden_size = config.hidden_size self.layer_idx = extract_layer_index(prefix) self.self_attn = Cohere2MoeAttention( config, cache_config, quant_config=quant_config, prefix=f"{prefix}.self_attn", ) if config.mlp_layer_types[self.layer_idx] == "dense": self.mlp = Cohere2MoeMLP( config=config, intermediate_size=getattr( config, "prefix_dense_intermediate_size", config.intermediate_size ), quant_config=quant_config, reduce_results=True, prefix=f"{prefix}.mlp", ) else: self.mlp = Cohere2Moe( config=config, quant_config=quant_config, prefix=f"{prefix}.mlp" ) norm_cls, norm_eps = select_norm_impl(config) self.input_layernorm = norm_cls(param_shape=(config.hidden_size,), eps=norm_eps) def forward( self, positions: torch.Tensor, hidden_states: torch.Tensor, residual: torch.Tensor | None, ) -> tuple[torch.Tensor, torch.Tensor]: residual = hidden_states hidden_states, residual = self.input_layernorm(hidden_states, residual) hidden_states_attention = self.self_attn( positions=positions, hidden_states=hidden_states, ) hidden_states_mlp = self.mlp(hidden_states) hidden_states = residual + hidden_states_attention + hidden_states_mlp return hidden_states, residual @support_torch_compile class Cohere2MoeModel(nn.Module): """Transformer decoder for Cohere2Moe.""" def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""): super().__init__() config = vllm_config.model_config.hf_config cache_config = vllm_config.cache_config quant_config = vllm_config.quant_config self.config = config self.quant_config = quant_config self.vocab_size = config.vocab_size self.org_vocab_size = config.vocab_size self.embed_tokens = VocabParallelEmbedding( config.vocab_size, config.hidden_size ) # Decoder layers read per-layer MLP layout from config.mlp_layer_types # (dense MLP vs MoE) and use it for weight loading. Transformers >=5.10 # populates this field; older versions only expose first_k_dense_replace. # Normalize here so layer construction below sees a consistent layout. if getattr(config, "mlp_layer_types", None) is None: first_k_dense_replace = getattr(config, "first_k_dense_replace", None) n = config.num_hidden_layers if first_k_dense_replace is not None: config.mlp_layer_types = ["dense"] * first_k_dense_replace + [ "sparse" ] * (n - first_k_dense_replace) else: config.mlp_layer_types = ["sparse"] * n self.start_layer, self.end_layer, self.layers = make_layers( config.num_hidden_layers, lambda prefix: Cohere2MoeDecoderLayer( config, cache_config, quant_config, prefix=prefix ), prefix=f"{prefix}.layers", ) norm_cls, norm_eps = select_norm_impl(config) self.norm = norm_cls(param_shape=(config.hidden_size,), eps=norm_eps) self.make_empty_intermediate_tensors = make_empty_intermediate_tensors_factory( ["hidden_states", "residual"], config.hidden_size ) def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor: return self.embed_tokens(input_ids) def forward( self, input_ids: torch.Tensor, positions: torch.Tensor, intermediate_tensors: IntermediateTensors | None = None, inputs_embeds: torch.Tensor | None = None, ) -> torch.Tensor | IntermediateTensors: if get_pp_group().is_first_rank: if inputs_embeds is not None: hidden_states = inputs_embeds else: hidden_states = self.get_input_embeddings(input_ids) residual = None else: assert intermediate_tensors is not None hidden_states = intermediate_tensors["hidden_states"] residual = intermediate_tensors["residual"] for layer in islice(self.layers, self.start_layer, self.end_layer): hidden_states, residual = layer(positions, hidden_states, residual) if not get_pp_group().is_last_rank: return IntermediateTensors( {"hidden_states": hidden_states, "residual": residual} ) hidden_states, _ = self.norm(hidden_states, residual) return hidden_states class Cohere2MoeForCausalLM(nn.Module, SupportsPP, SupportsQuant): is_text_generation_model = True hf_to_vllm_mapper = WeightsMapper( orig_to_new_stacked={ # weight_name: (param_name, shard_id) ".q_proj": (".qkv_proj", "q"), ".k_proj": (".qkv_proj", "k"), ".v_proj": (".qkv_proj", "v"), # .experts.gate_up_proj must be handled by MoERunner.load_weights for EP ".mlp.gate_proj": (".mlp.gate_up_proj", 0), ".mlp.up_proj": (".mlp.gate_up_proj", 1), ".shared_experts.gate_proj": (".shared_experts.gate_up_proj", 0), ".shared_experts.up_proj": (".shared_experts.gate_up_proj", 1), } ) packed_modules_mapping = { "qkv_proj": [ "q_proj", "k_proj", "v_proj", ], "gate_up_proj": [ "gate_proj", "up_proj", ], } def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""): super().__init__() config = vllm_config.model_config.hf_config quant_config = vllm_config.quant_config self.config = config assert getattr(config, "tie_word_embeddings", True) self.unpadded_vocab_size = config.vocab_size self.quant_config = quant_config self.logits_scale = config.logit_scale self.logits_processor = LogitsProcessor( self.unpadded_vocab_size, config.vocab_size, scale=self.logits_scale ) self.model = Cohere2MoeModel( vllm_config=vllm_config, prefix=maybe_prefix(prefix, "model") ) self.make_empty_intermediate_tensors = ( self.model.make_empty_intermediate_tensors ) def embed_input_ids(self, input_ids: torch.Tensor) -> torch.Tensor: return self.model.get_input_embeddings(input_ids) def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor: return self.model.get_input_embeddings(input_ids) @torch.no_grad() def forward( self, input_ids: torch.Tensor, positions: torch.Tensor, intermediate_tensors: IntermediateTensors | None = None, inputs_embeds: torch.Tensor | None = None, ) -> torch.Tensor | IntermediateTensors: return self.model(input_ids, positions, intermediate_tensors, inputs_embeds) def compute_logits( self, hidden_states: torch.Tensor, ) -> torch.Tensor | None: return self.logits_processor(self.model.embed_tokens, hidden_states) def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]) -> set[str]: loader = AutoWeightsLoader(self, skip_prefixes=["lm_head."]) return loader.load_weights(weights, mapper=self.hf_to_vllm_mapper)