§
    ‚Štj¸Ñ  ã                   ó  — d dl mZ d dlZd dlmZ d dlmZmZmZ ddlm	Z
 ddlmZmZ ddlmZmZmZ ddlmZ dd	lmZmZ dd
lmZ ddlmZmZmZmZmZmZm Z m!Z! ddl"m#Z#m$Z$ ddl%m&Z& ddl'm(Z( ddl)m*Z*m+Z+m,Z, ddl-m.Z.m/Z/ ddl0m1Z1 ddl2m3Z3  e,j4        e5¦  «        Z6 G d„ dej7        ¦  «        Z8	 	 dKdej7        dej9        dej9        dej9        dej9        dz  de:dz  de:de&e*         fd„Z; G d „ d!ej7        ¦  «        Z< G d"„ d#ej7        ¦  «        Z= G d$„ d%ej7        ¦  «        Z> G d&„ d'ej7        ¦  «        Z? G d(„ d)ej7        ¦  «        Z@ G d*„ d+ej7        ¦  «        ZA G d,„ d-e¦  «        ZB G d.„ d/ej7        ¦  «        ZCe+ G d0„ d1e$¦  «        ¦   «         ZD G d2„ d3ej7        ¦  «        ZE G d4„ d5ej7        ¦  «        ZF e+d6¬7¦  «         G d8„ d9eD¦  «        ¦   «         ZGe+ G d:„ d;eD¦  «        ¦   «         ZH G d<„ d=ej7        ¦  «        ZI e+d>¬7¦  «         G d?„ d@eD¦  «        ¦   «         ZJe+ G dA„ dBeD¦  «        ¦   «         ZKe+ G dC„ dDeD¦  «        ¦   «         ZLe+ G dE„ dFeD¦  «        ¦   «         ZM e+dG¬7¦  «         G dH„ dIeDe¦  «        ¦   «         ZNg dJ¢ZOdS )Lé    )ÚCallableN)ÚBCEWithLogitsLossÚCrossEntropyLossÚMSELossé   )Úinitialization)ÚACT2FNÚgelu)ÚCacheÚDynamicCacheÚEncoderDecoderCache)ÚGenerationMixin)Úcreate_bidirectional_maskÚcreate_causal_mask)ÚGradientCheckpointingLayer)Ú)BaseModelOutputWithPastAndCrossAttentionsÚ,BaseModelOutputWithPoolingAndCrossAttentionsÚ!CausalLMOutputWithCrossAttentionsÚMaskedLMOutputÚMultipleChoiceModelOutputÚQuestionAnsweringModelOutputÚSequenceClassifierOutputÚTokenClassifierOutput)ÚALL_ATTENTION_FUNCTIONSÚPreTrainedModel)ÚUnpack)Úapply_chunking_to_forward)ÚTransformersKwargsÚauto_docstringÚlogging)Úcan_return_tupleÚmerge_with_config_defaults)Úcapture_outputsé   )ÚCamembertConfigc                   óÆ   ‡ — e Zd ZdZˆ fd„Z	 	 	 	 	 ddej        dz  dej        dz  dej        dz  dej        dz  d	ed
ej	        fd„Z
ed„ ¦   «         Zedd„¦   «         Zˆ xZS )ÚCamembertEmbeddingszGConstruct the embeddings from word, position and token_type embeddings.c                 óø  •— t          ¦   «                              ¦   «          t          j        |j        |j        |j        ¬¦  «        | _        t          j        |j        |j        ¦  «        | _	        t          j
        |j        |j        ¬¦  «        | _
        t          j        |j        ¦  «        | _        |                      dt!          j        |j        ¦  «                             d¦  «        d¬¦  «         |                      dt!          j        | j                             ¦   «         t           j        ¬¦  «        d¬¦  «         |j        | _        t          j        |j        |j        | j        ¬¦  «        | _        d S )	N)Úpadding_idx©ÚepsÚposition_ids©r$   éÿÿÿÿF)Ú
persistentÚtoken_type_ids)Údtype)ÚsuperÚ__init__ÚnnÚ	EmbeddingÚ
vocab_sizeÚhidden_sizeÚpad_token_idÚword_embeddingsÚtype_vocab_sizeÚtoken_type_embeddingsÚ	LayerNormÚlayer_norm_epsÚDropoutÚhidden_dropout_probÚdropoutÚregister_bufferÚtorchÚarangeÚmax_position_embeddingsÚexpandÚzerosr,   ÚsizeÚlongr)   Úposition_embeddings©ÚselfÚconfigÚ	__class__s     €ún/var/www/html/CA-Chatbot/venv/lib/python3.11/site-packages/transformers/models/camembert/modeling_camembert.pyr3   zCamembertEmbeddings.__init__;   sJ  ø€ Ý‰Œ×ÒÑÔÐÝ!œ|¨FÔ,=¸vÔ?QÐ_eÔ_rÐsÑsÔsˆÔÝ%'¤\°&Ô2HÈ&ÔJ\Ñ%]Ô%]ˆÔ"åœ fÔ&8¸fÔ>SÐTÑTÔTˆŒÝ”z &Ô"<Ñ=Ô=ˆŒà×ÒØ�EœL¨Ô)GÑHÔH×OÒOÐPWÑXÔXÐejð 	ñ 	
ô 	
ð 	
ð 	×ÒØ�eœk¨$Ô*;×*@Ò*@Ñ*BÔ*BÍ%Ì*ÐUÑUÔUÐbgð 	ñ 	
ô 	
ð 	
ð "Ô.ˆÔÝ#%¤<ØÔ*¨FÔ,>ÈDÔL\ð$
ñ $
ô $
ˆÔ Ð Ð ó    Nr   Ú	input_idsr0   r,   Úinputs_embedsÚpast_key_values_lengthÚreturnc                 ó*  — |€:|�|                       || j        |¦  «        }n|                      || j        ¦  «        }|�|                     ¦   «         }n|                     ¦   «         d d…         }|\  }}|€§t	          | d¦  «        rl| j                             |j        ¦  «                             |j	        d         d¦  «        }	t          j        |	d|¬¦  «        }	|	                     ||¦  «        }n+t          j        |t          j        | j        j        ¬¦  «        }|€|                      |¦  «        }|                      |¦  «        }
||
z   }|                      |¦  «        }||z   }|                      |¦  «        }|                      |¦  «        }|S )Nr.   r0   r   r$   )ÚdimÚindex©r1   Údevice)Ú"create_position_ids_from_input_idsr)   Ú&create_position_ids_from_inputs_embedsrG   Úhasattrr0   ÚtorX   rE   ÚshaperB   ÚgatherrF   rH   r,   r9   r;   rI   r<   r@   )rK   rP   r0   r,   rQ   rR   Úinput_shapeÚ
batch_sizeÚ
seq_lengthÚbuffered_token_type_idsr;   Ú
embeddingsrI   s                rN   ÚforwardzCamembertEmbeddings.forwardO   s¨  € ð ÐØÐ$à#×FÒFØ˜tÔ/Ð1Gñ ô  ��ð  $×JÒJÈ=ÐZ^ÔZjÑkÔk�àÐ Ø#Ÿ.š.Ñ*Ô*ˆKˆKà'×,Ò,Ñ.Ô.¨s°¨sÔ3ˆKà!,Ñˆ
�Jð
 Ð!Ý�tÐ-Ñ.Ô.ð mà*.Ô*=×*@Ò*@ÀÔATÑ*UÔ*U×*\Ò*\Ð]iÔ]oÐpqÔ]rÐtvÑ*wÔ*wÐ'Ý*/¬,Ð7NÐTUÐ]iÐ*jÑ*jÔ*jÐ'Ø!8×!?Ò!?À
ÈJÑ!WÔ!W��å!&¤¨[ÅÄ
ÐSWÔSdÔSkÐ!lÑ!lÔ!l�àÐ Ø ×0Ò0°Ñ;Ô;ˆMØ $× :Ò :¸>Ñ JÔ JÐØ"Ð%:Ñ:ˆ
à"×6Ò6°|ÑDÔDÐØÐ"5Ñ5ˆ
à—^’^ JÑ/Ô/ˆ
Ø—\’\ *Ñ-Ô-ˆ
ØÐrO   c                 óú   — |                       ¦   «         dd…         }|d         }t          j        |dz   ||z   dz   t          j        | j        ¬¦  «        }|                     d¦  «                             |¦  «        S )z×
        We are provided embeddings directly. We cannot infer which are padded so just generate sequential position ids.

        Args:
            inputs_embeds: torch.Tensor

        Returns: torch.Tensor
        Nr.   r$   rW   r   )rG   rB   rC   rH   rX   Ú	unsqueezerE   )rQ   r)   r_   Úsequence_lengthr,   s        rN   rZ   z:CamembertEmbeddings.create_position_ids_from_inputs_embeds   s~   € ð $×(Ò(Ñ*Ô*¨3¨B¨3Ô/ˆØ% aœ.ˆå”|Ø˜!‰O˜_¨{Ñ:¸QÑ>ÅeÄjÐYfÔYmð
ñ 
ô 
ˆð ×%Ò% aÑ(Ô(×/Ò/°Ñ<Ô<Ð<rO   c                 óÜ   — |                       |¦  «                             ¦   «         }t          j        |d¬¦  «                             |¦  «        |z   |z  }|                     ¦   «         |z   S )a  
        Replace non-padding symbols with their position numbers. Position numbers begin at padding_idx+1. Padding symbols
        are ignored. This is modified from fairseq's `utils.make_positions`.

        Args:
            x: torch.Tensor x:

        Returns: torch.Tensor
        r$   ©rU   )ÚneÚintrB   ÚcumsumÚtype_asrH   )rP   r)   rR   ÚmaskÚincremental_indicess        rN   rY   z6CamembertEmbeddings.create_position_ids_from_input_ids‘   sg   € ð �|Š|˜KÑ(Ô(×,Ò,Ñ.Ô.ˆÝ$œ|¨D°aÐ8Ñ8Ô8×@Ò@ÀÑFÔFÐI_Ñ_ÐcgÑgÐØ"×'Ò'Ñ)Ô)¨KÑ7Ð7rO   )NNNNr   )r   )Ú__name__Ú
__module__Ú__qualname__Ú__doc__r3   rB   Ú
LongTensorÚFloatTensorrk   ÚTensorrd   ÚstaticmethodrZ   rY   Ú__classcell__©rM   s   @rN   r'   r'   8   s   ø€ € € € € ØQÐQð
ð 
ð 
ð 
ð 
ð, .2Ø26Ø04Ø26Ø&'ð.ð .àÔ# dÑ*ð.ð Ô(¨4Ñ/ð.ð Ô&¨Ñ-ð	.ð
 Ô(¨4Ñ/ð.ð !$ð.ð 
Œð.ð .ð .ð .ð` ð=ð =ñ „\ð=ð" ð8ð 8ð 8ñ „\ð8ð 8ð 8ð 8ð 8rO   r'   ç        ÚmoduleÚqueryÚkeyÚvalueÚattention_maskÚscalingr@   Úkwargsc                 ó®  — |€|                      d¦  «        dz  }t          j        ||                     dd¦  «        ¦  «        |z  }|�||z   }t          j                             |d¬¦  «        }t          j                             ||| j        ¬¦  «        }t          j        ||¦  «        }	|	                     dd¦  «         	                    ¦   «         }	|	|fS )Nr.   ç      à¿é   r   ri   )ÚpÚtrainingr$   )
rG   rB   ÚmatmulÚ	transposer4   Ú
functionalÚsoftmaxr@   r†   Ú
contiguous)
r{   r|   r}   r~   r   r€   r@   r�   Úattn_weightsÚattn_outputs
             rN   Úeager_attention_forwardrŽ   ¢   sÈ   € ð €Ø—*’*˜R‘.”. DÑ(ˆõ ”<  s§}¢}°Q¸Ñ':Ô':Ñ;Ô;¸gÑE€LàÐ!Ø# nÑ4ˆå”=×(Ò(¨¸2Ð(Ñ>Ô>€LÝ”=×(Ò(¨¸È6Ì?Ð(Ñ[Ô[€Lå”,˜|¨UÑ3Ô3€KØ×'Ò'¨¨1Ñ-Ô-×8Ò8Ñ:Ô:€Kà˜Ð$Ð$rO   c                   ó„   ‡ — e Zd Zd
ˆ fd„	Z	 	 ddej        dej        dz  dedz  dee	         de
ej                 f
d	„Zˆ xZS )ÚCamembertSelfAttentionFNc                 óÄ  •— t          ¦   «                              ¦   «          |j        |j        z  dk    r0t	          |d¦  «        s t          d|j        › d|j        › d�¦  «        ‚|| _        |j        | _        t          |j        |j        z  ¦  «        | _        | j        | j        z  | _	        | j        dz  | _
        t          j        |j        | j	        ¦  «        | _        t          j        |j        | j	        ¦  «        | _        t          j        |j        | j	        ¦  «        | _        t          j        |j        ¦  «        | _        |j        | _        || _        || _        d S ©Nr   Úembedding_sizezThe hidden size (z6) is not a multiple of the number of attention heads (ú)rƒ   )r2   r3   r7   Únum_attention_headsr[   Ú
ValueErrorrL   rk   Úattention_head_sizeÚall_head_sizer€   r4   ÚLinearr|   r}   r~   r>   Úattention_probs_dropout_probr@   Ú
is_decoderÚ	is_causalÚ	layer_idx©rK   rL   rœ   r�   rM   s       €rN   r3   zCamembertSelfAttention.__init__¿   sG  ø€ Ý‰Œ×ÒÑÔÐØÔ Ô :Ñ:¸aÒ?Ð?ÍÐPVÐXhÑHiÔHiÐ?Ýð8 FÔ$6ð 8ð 8Ø Ô4ð8ð 8ð 8ñô ð ð ˆŒà#)Ô#=ˆÔ Ý#& vÔ'9¸FÔ<VÑ'VÑ#WÔ#WˆÔ Ø!Ô5¸Ô8PÑPˆÔØÔ/°Ñ5ˆŒå”Y˜vÔ1°4Ô3EÑFÔFˆŒ
Ý”9˜VÔ/°Ô1CÑDÔDˆŒÝ”Y˜vÔ1°4Ô3EÑFÔFˆŒ
å”z &Ô"EÑFÔFˆŒà Ô+ˆŒØ"ˆŒØ"ˆŒˆˆrO   Úhidden_statesr   Úpast_key_valuesr�   rS   c                 óÈ  — |j         d d…         }g |¢d‘| j        ‘R } |                      |¦  «        j        |Ž                      dd¦  «        } |                      |¦  «        j        |Ž                      dd¦  «        } |                      |¦  «        j        |Ž                      dd¦  «        }	|�=|}
t          |t          ¦  «        r|j	        }
|
 
                    ||	| j        ¦  «        \  }}	t          j        | j        j        t           ¦  «        } || |||	|f| j        sdn| j        j        | j        dœ|¤Ž\  }} |j        g |¢d‘R Ž                      ¦   «         }||fS )Nr.   r$   r„   rz   ©r@   r€   )r]   r—   r|   Úviewrˆ   r}   r~   Ú
isinstancer   Úself_attention_cacheÚupdater�   r   Úget_interfacerL   Ú_attn_implementationrŽ   r†   r@   r…   r€   Úreshaper‹   )rK   rŸ   r   r    r�   r_   Úhidden_shapeÚquery_layerÚ	key_layerÚvalue_layerÚcurrent_past_key_valuesÚattention_interfacer�   rŒ   s                 rN   rd   zCamembertSelfAttention.forward×   s¨  € ð $Ô)¨#¨2¨#Ô.ˆØC˜ÐC bÐC¨$Ô*BÐCÐCˆð 5�d—j’j Ñ/Ô/Ô4°lÐC×MÒMÈaÐQRÑSÔSˆØ0�D—H’H˜]Ñ+Ô+Ô0°,Ð?×IÒIÈ!ÈQÑOÔOˆ	Ø4�d—j’j Ñ/Ô/Ô4°lÐC×MÒMÈaÐQRÑSÔSˆàÐ&à&5Ð#Ý˜/Õ+>Ñ?Ô?ð OØ*9Ô*NÐ'ð &=×%CÒ%CÀIÈ{Ð\`Ô\jÑ%kÔ%kÑ"ˆI�{å(?Ô(MØŒKÔ,Õ.Eñ)
ô )
Ðð %8Ð$7ØØØØØð	%
ð  $œ}Ð@�C�C°$´,´.Ø”Lð	%
ð 	%
ð ð	%
ð 	%
Ñ!ˆ�\ð *�kÔ)Ð;¨;Ð;¸Ð;Ð;Ð;×FÒFÑHÔHˆØ˜LÐ(Ð(rO   ©FN)NN©rp   rq   rr   r3   rB   rv   ru   r   r   r   Útuplerd   rx   ry   s   @rN   r�   r�   ¾   s©   ø€ € € € € ð#ð #ð #ð #ð #ð #ð6 48Ø(,ð	')ð ')à”|ð')ð Ô)¨DÑ0ð')ð  ™ð	')ð
 Ð+Ô,ð')ð 
ˆuŒ|Ô	ð')ð ')ð ')ð ')ð ')ð ')ð ')ð ')rO   r�   c                   óš   ‡ — e Zd Zdˆ fd„	Z	 	 	 ddej        dej        dz  dej        dz  dedz  dee	         d	e
ej                 fd
„Zˆ xZS )ÚCamembertCrossAttentionFNc                 ó¬  •— t          ¦   «                              ¦   «          |j        |j        z  dk    r0t	          |d¦  «        s t          d|j        › d|j        › d�¦  «        ‚|| _        |j        | _        t          |j        |j        z  ¦  «        | _        | j        | j        z  | _	        | j        dz  | _
        t          j        |j        | j	        ¦  «        | _        t          j        |j        | j	        ¦  «        | _        t          j        |j        | j	        ¦  «        | _        t          j        |j        ¦  «        | _        || _        || _        d S r’   )r2   r3   r7   r•   r[   r–   rL   rk   r—   r˜   r€   r4   r™   r|   r}   r~   r>   rš   r@   rœ   r�   rž   s       €rN   r3   z CamembertCrossAttention.__init__  s=  ø€ Ý‰Œ×ÒÑÔÐØÔ Ô :Ñ:¸aÒ?Ð?ÍÐPVÐXhÑHiÔHiÐ?Ýð8 FÔ$6ð 8ð 8Ø Ô4ð8ð 8ð 8ñô ð ð ˆŒà#)Ô#=ˆÔ Ý#& vÔ'9¸FÔ<VÑ'VÑ#WÔ#WˆÔ Ø!Ô5¸Ô8PÑPˆÔØÔ/°Ñ5ˆŒå”Y˜vÔ1°4Ô3EÑFÔFˆŒ
Ý”9˜VÔ/°Ô1CÑDÔDˆŒÝ”Y˜vÔ1°4Ô3EÑFÔFˆŒ
å”z &Ô"EÑFÔFˆŒà"ˆŒØ"ˆŒˆˆrO   rŸ   Úencoder_hidden_statesr   r    r�   rS   c                 óì  — |j         d d…         }g |¢d‘| j        ‘R }|                      |¦  «                             |¦  «                             dd¦  «        }|�|j                             | j        ¦  «        nd}	|�;|	r9|j        j	        | j                 j
        }
|j        j	        | j                 j        }nÈg |j         d d…         ¢d‘| j        ‘R }|                      |¦  «                             |¦  «                             dd¦  «        }
|                      |¦  «                             |¦  «                             dd¦  «        }|�3|j                             |
|| j        ¦  «        \  }
}d|j        | j        <   t          j        | j        j        t&          ¦  «        } || ||
||f| j        sdn| j        j        | j        dœ|¤Ž\  }} |j        g |¢d‘R Ž                      ¦   «         }||fS )Nr.   r$   r„   FTrz   r¢   )r]   r—   r|   r£   rˆ   Ú
is_updatedÚgetr�   Úcross_attention_cacheÚlayersÚkeysÚvaluesr}   r~   r¦   r   r§   rL   r¨   rŽ   r†   r@   r…   r€   r©   r‹   )rK   rŸ   r¶   r   r    r�   r_   rª   r«   r¸   r¬   r­   Úkv_shaper¯   r�   rŒ   s                   rN   rd   zCamembertCrossAttention.forward  s-  € ð $Ô)¨#¨2¨#Ô.ˆàC˜ÐC bÐC¨$Ô*BÐCÐCˆð —j’j Ñ/Ô/×4Ò4°\ÑBÔB×LÒLÈQÐPQÑRÔRˆàGVÐGb�_Ô/×3Ò3°D´NÑCÔCÐCÐhmˆ
ØÐ&¨:Ð&à'Ô=ÔDÀTÄ^ÔTÔYˆIØ)Ô?ÔFÀtÄ~ÔVÔ]ˆKˆKàXÐ.Ô4°S°b°SÔ9ÐX¸2ÐX¸tÔ?WÐXÐXˆHØŸšÐ!6Ñ7Ô7×<Ò<¸XÑFÔF×PÒPÐQRÐTUÑVÔVˆIØŸ*š*Ð%:Ñ;Ô;×@Ò@ÀÑJÔJ×TÒTÐUVÐXYÑZÔZˆKàÐ*à)8Ô)N×)UÒ)UØ˜{¨D¬Nñ*ô *Ñ&�	˜;ð >B�Ô*¨4¬>Ñ:å(?Ô(MØŒKÔ,Õ.Eñ)
ô )
Ðð %8Ð$7ØØØØØð	%
ð  $œ}Ð@�C�C°$´,´.Ø”Lð	%
ð 	%
ð ð	%
ð 	%
Ñ!ˆ�\ð *�kÔ)Ð;¨;Ð;¸Ð;Ð;Ð;×FÒFÑHÔHˆØ˜LÐ(Ð(rO   r°   )NNN)rp   rq   rr   r3   rB   rv   ru   r   r   r   r²   rd   rx   ry   s   @rN   r´   r´     s¿   ø€ € € € € ð#ð #ð #ð #ð #ð #ð4 ;?Ø37Ø6:ð1)ð 1)à”|ð1)ð  %Ô0°4Ñ7ð1)ð Ô)¨DÑ0ð	1)ð
 -¨tÑ3ð1)ð Ð+Ô,ð1)ð 
ˆuŒ|Ô	ð1)ð 1)ð 1)ð 1)ð 1)ð 1)ð 1)ð 1)rO   r´   c                   óP   ‡ — e Zd Zˆ fd„Zdej        dej        dej        fd„Zˆ xZS )ÚCamembertSelfOutputc                 ó  •— t          ¦   «                              ¦   «          t          j        |j        |j        ¦  «        | _        t          j        |j        |j        ¬¦  «        | _        t          j        |j	        ¦  «        | _
        d S ©Nr*   )r2   r3   r4   r™   r7   Údenser<   r=   r>   r?   r@   rJ   s     €rN   r3   zCamembertSelfOutput.__init__N  sf   ø€ Ý‰Œ×ÒÑÔÐÝ”Y˜vÔ1°6Ô3EÑFÔFˆŒ
Ýœ fÔ&8¸fÔ>SÐTÑTÔTˆŒÝ”z &Ô"<Ñ=Ô=ˆŒˆˆrO   rŸ   Úinput_tensorrS   c                 óŠ   — |                       |¦  «        }|                      |¦  «        }|                      ||z   ¦  «        }|S ©N©rÃ   r@   r<   ©rK   rŸ   rÄ   s      rN   rd   zCamembertSelfOutput.forwardT  ó@   € ØŸ
š
 =Ñ1Ô1ˆØŸš ]Ñ3Ô3ˆØŸš }°|Ñ'CÑDÔDˆØÐrO   ©rp   rq   rr   r3   rB   rv   rd   rx   ry   s   @rN   rÀ   rÀ   M  ói   ø€ € € € € ð>ð >ð >ð >ð >ð U¤\ð ÀÄð ÐRWÔR^ð ð ð ð ð ð ð ð rO   rÀ   c                   ó°   ‡ — e Zd Zdˆ fd„	Z	 	 	 	 ddej        dej        dz  dej        dz  dej        dz  dedz  d	ee	         d
e
ej                 fd„Zˆ xZS )ÚCamembertAttentionFNc                 óÄ   •— t          ¦   «                              ¦   «          || _        |rt          nt          } ||||¬¦  «        | _        t          |¦  «        | _        d S )N©rœ   r�   )r2   r3   Úis_cross_attentionr´   r�   rK   rÀ   Úoutput)rK   rL   rœ   r�   rÐ   Úattention_classrM   s         €rN   r3   zCamembertAttention.__init__\  s]   ø€ Ý‰Œ×ÒÑÔÐØ"4ˆÔØ5GÐcÕ1Ð1ÕMcˆØ#�O F°iÈ9ÐUÑUÔUˆŒ	Ý)¨&Ñ1Ô1ˆŒˆˆrO   rŸ   r   r¶   Úencoder_attention_maskr    r�   rS   c                 óv   — | j         s|n|} | j        |f|||dœ|¤Ž\  }}|                      ||¦  «        }||fS )N)r¶   r   r    )rÐ   rK   rÑ   )	rK   rŸ   r   r¶   rÓ   r    r�   Úattention_outputrŒ   s	            rN   rd   zCamembertAttention.forwardc  sq   € ð 04Ô/FÐb˜˜ÐLbˆØ)2¨¬Øð*
à"7Ø)Ø+ð	*
ð *
ð
 ð*
ð *
Ñ&Ð˜,ð  Ÿ;š;Ð'7¸ÑGÔGÐØ Ð-Ð-rO   )FNF©NNNNr±   ry   s   @rN   rÍ   rÍ   [  sÓ   ø€ € € € € ð2ð 2ð 2ð 2ð 2ð 2ð 48Ø:>Ø;?Ø(,ð.ð .à”|ð.ð Ô)¨DÑ0ð.ð  %Ô0°4Ñ7ð	.ð
 !&Ô 1°DÑ 8ð.ð  ™ð.ð Ð+Ô,ð.ð 
ˆuŒ|Ô	ð.ð .ð .ð .ð .ð .ð .ð .rO   rÍ   c                   óB   ‡ — e Zd Zˆ fd„Zdej        dej        fd„Zˆ xZS )ÚCamembertIntermediatec                 ó  •— t          ¦   «                              ¦   «          t          j        |j        |j        ¦  «        | _        t          |j        t          ¦  «        rt          |j                 | _        d S |j        | _        d S rÆ   )r2   r3   r4   r™   r7   Úintermediate_sizerÃ   r¤   Ú
hidden_actÚstrr	   Úintermediate_act_fnrJ   s     €rN   r3   zCamembertIntermediate.__init__y  sn   ø€ Ý‰Œ×ÒÑÔÐÝ”Y˜vÔ1°6Ô3KÑLÔLˆŒ
Ý�fÔ'­Ñ-Ô-ð 	9Ý'-¨fÔ.?Ô'@ˆDÔ$Ð$Ð$à'-Ô'8ˆDÔ$Ð$Ð$rO   rŸ   rS   c                 óZ   — |                       |¦  «        }|                      |¦  «        }|S rÆ   )rÃ   rÝ   )rK   rŸ   s     rN   rd   zCamembertIntermediate.forward�  s,   € ØŸ
š
 =Ñ1Ô1ˆØ×0Ò0°Ñ?Ô?ˆØÐrO   rÊ   ry   s   @rN   rØ   rØ   x  s^   ø€ € € € € ð9ð 9ð 9ð 9ð 9ð U¤\ð °e´lð ð ð ð ð ð ð ð rO   rØ   c                   óP   ‡ — e Zd Zˆ fd„Zdej        dej        dej        fd„Zˆ xZS )ÚCamembertOutputc                 ó  •— t          ¦   «                              ¦   «          t          j        |j        |j        ¦  «        | _        t          j        |j        |j        ¬¦  «        | _        t          j	        |j
        ¦  «        | _        d S rÂ   )r2   r3   r4   r™   rÚ   r7   rÃ   r<   r=   r>   r?   r@   rJ   s     €rN   r3   zCamembertOutput.__init__ˆ  sf   ø€ Ý‰Œ×ÒÑÔÐÝ”Y˜vÔ7¸Ô9KÑLÔLˆŒ
Ýœ fÔ&8¸fÔ>SÐTÑTÔTˆŒÝ”z &Ô"<Ñ=Ô=ˆŒˆˆrO   rŸ   rÄ   rS   c                 óŠ   — |                       |¦  «        }|                      |¦  «        }|                      ||z   ¦  «        }|S rÆ   rÇ   rÈ   s      rN   rd   zCamembertOutput.forwardŽ  rÉ   rO   rÊ   ry   s   @rN   rà   rà   ‡  rË   rO   rà   c                   óª   ‡ — e Zd Zdˆ fd„	Z	 	 	 	 ddej        dej        dz  dej        dz  dej        dz  dedz  dee	         d	ej        fd
„Z
d„ Zˆ xZS )ÚCamembertLayerNc                 ó–  •— t          ¦   «                              ¦   «          |j        | _        d| _        t	          ||j        |¬¦  «        | _        |j        | _        |j        | _        | j        r1| j        st          | › d�¦  «        ‚t	          |d|d¬¦  «        | _	        t          |¦  «        | _        t          |¦  «        | _        d S )Nr$   rÏ   z> should be used as a decoder model if cross attention is addedFT)rœ   r�   rÐ   )r2   r3   Úchunk_size_feed_forwardÚseq_len_dimrÍ   r›   Ú	attentionÚadd_cross_attentionr–   ÚcrossattentionrØ   Úintermediaterà   rÑ   )rK   rL   r�   rM   s      €rN   r3   zCamembertLayer.__init__–  sÐ   ø€ Ý‰Œ×ÒÑÔÐØ'-Ô'EˆÔ$ØˆÔÝ+¨F¸fÔ>OÐ[dÐeÑeÔeˆŒØ Ô+ˆŒØ#)Ô#=ˆÔ ØÔ#ð 	Ø”?ð jÝ  DÐ!hÐ!hÐ!hÑiÔiÐiÝ"4ØØØ#Ø#'ð	#ñ #ô #ˆDÔõ 2°&Ñ9Ô9ˆÔÝ% fÑ-Ô-ˆŒˆˆrO   rŸ   r   r¶   rÓ   r    r�   rS   c                 óü   —  | j         ||fd|i|¤Ž\  }}|}	| j        r=|�;t          | d¦  «        st          d| › d�¦  «        ‚ | j        |d ||fd|i|¤Ž\  }
}|
}	t          | j        | j        | j        |	¦  «        }|S )Nr    rê   z'If `encoder_hidden_states` are passed, z` has to be instantiated with cross-attention layers by setting `config.add_cross_attention=True`)	rè   r›   r[   r–   rê   r   Úfeed_forward_chunkræ   rç   )rK   rŸ   r   r¶   rÓ   r    r�   Úself_attention_outputÚ_rÕ   Úcross_attention_outputÚlayer_outputs               rN   rd   zCamembertLayer.forward©  s  € ð $2 4¤>ØØð$
ð $
ð ,ð$
ð ð	$
ð $
Ñ Ð˜qð 1ÐàŒ?ð 	6Ð4Ð@Ý˜4Ð!1Ñ2Ô2ð Ý ðD¸dð Dð Dð Dñô ð ð
 )<¨Ô(;Ø%ØØ%Ø&ð	)ð )ð
 !0ð)ð ð)ð )Ñ%Ð" Að  6Ðå0ØÔ# TÔ%AÀ4ÔCSÐUeñ
ô 
ˆð ÐrO   c                 ó\   — |                       |¦  «        }|                      ||¦  «        }|S rÆ   )rë   rÑ   )rK   rÕ   Úintermediate_outputrñ   s       rN   rí   z!CamembertLayer.feed_forward_chunkÐ  s2   € Ø"×/Ò/Ð0@ÑAÔAÐØ—{’{Ð#6Ð8HÑIÔIˆØÐrO   rÆ   rÖ   )rp   rq   rr   r3   rB   rv   ru   r   r   r   rd   rí   rx   ry   s   @rN   rä   rä   •  sÞ   ø€ € € € € ð.ð .ð .ð .ð .ð .ð, 48Ø:>Ø;?Ø(,ð%ð %à”|ð%ð Ô)¨DÑ0ð%ð  %Ô0°4Ñ7ð	%ð
 !&Ô 1°DÑ 8ð%ð  ™ð%ð Ð+Ô,ð%ð 
Œð%ð %ð %ð %ðNð ð ð ð ð ð rO   rä   c                   ó(   ‡ — e Zd ZdZˆ fd„Zd„ Zˆ xZS )ÚCamembertLMHeadz,Camembert Head for masked language modeling.c                 ó‚  •— t          ¦   «                              ¦   «          t          j        |j        |j        ¦  «        | _        t          j        |j        |j        ¬¦  «        | _        t          j        |j        |j	        ¦  «        | _
        t          j        t          j        |j	        ¦  «        ¦  «        | _        d S rÂ   )r2   r3   r4   r™   r7   rÃ   r<   r=   Ú
layer_normr6   ÚdecoderÚ	ParameterrB   rF   ÚbiasrJ   s     €rN   r3   zCamembertLMHead.__init__Ù  s‰   ø€ Ý‰Œ×ÒÑÔÐÝ”Y˜vÔ1°6Ô3EÑFÔFˆŒ
Ýœ, vÔ'9¸vÔ?TÐUÑUÔUˆŒå”y Ô!3°VÔ5FÑGÔGˆŒÝ”L¥¤¨VÔ->Ñ!?Ô!?Ñ@Ô@ˆŒ	ˆ	ˆ	rO   c                 ó¢   — |                       |¦  «        }t          |¦  «        }|                      |¦  «        }|                      |¦  «        }|S rÆ   )rÃ   r
   r÷   rø   ©rK   Úfeaturesr�   Úxs       rN   rd   zCamembertLMHead.forwardá  sE   € Ø�JŠJ�xÑ Ô ˆÝ�‰GŒGˆØ�OŠO˜AÑÔˆð �LŠL˜‰OŒOˆàˆrO   ©rp   rq   rr   rs   r3   rd   rx   ry   s   @rN   rõ   rõ   Ö  sR   ø€ € € € € Ø6Ð6ðAð Að Að Að Aðð ð ð ð ð ð rO   rõ   c                   óp   ‡ — e Zd ZeZdZdZdZdZdZ	dZ
eeedœZ ej        ¦   «         ˆ fd„¦   «         Zˆ xZS )ÚCamembertPreTrainedModelÚrobertaT)rŸ   Ú
attentionsÚcross_attentionsc                 ó¨  •— t          ¦   «                              |¦  «         t          |t          ¦  «        rt	          j        |j        ¦  «         dS t          |t          ¦  «        rjt	          j        |j	        t          j        |j	        j        d         ¦  «                             d¦  «        ¦  «         t	          j        |j        ¦  «         dS dS )zInitialize the weightsr.   r-   N)r2   Ú_init_weightsr¤   rõ   ÚinitÚzeros_rú   r'   Úcopy_r,   rB   rC   r]   rE   r0   )rK   r{   rM   s     €rN   r  z&CamembertPreTrainedModel._init_weightsû  s·   ø€ õ 	‰Œ×Ò˜fÑ%Ô%Ð%Ý�f�oÑ.Ô.ð 	/ÝŒK˜œÑ$Ô$Ð$Ð$Ð$Ý˜Õ 3Ñ4Ô4ð 	/ÝŒJ�vÔ*­E¬L¸Ô9LÔ9RÐSUÔ9VÑ,WÔ,W×,^Ò,^Ð_fÑ,gÔ,gÑhÔhÐhÝŒK˜Ô-Ñ.Ô.Ð.Ð.Ð.ð	/ð 	/rO   )rp   rq   rr   r%   Úconfig_classÚbase_model_prefixÚsupports_gradient_checkpointingÚ_supports_flash_attnÚ_supports_sdpaÚ_supports_flex_attnÚ_supports_attention_backendrä   r�   r´   Ú_can_record_outputsrB   Úno_gradr  rx   ry   s   @rN   r  r  ì  sŠ   ø€ € € € € à"€LØ!ÐØ&*Ð#ØÐØ€NØÐØ"&Ðà'Ø,Ø3ðð Ðð €U„]�_„_ð/ð /ð /ð /ñ „_ð/ð /ð /ð /ð /rO   r  c                   óÀ   ‡ — e Zd Zˆ fd„Z	 	 	 	 	 ddej        dej        dz  dej        dz  dej        dz  dedz  dedz  d	e	e
         d
eej                 ez  fd„Zˆ xZS )ÚCamembertEncoderc                 óÆ   •‡— t          ¦   «                              ¦   «          ‰| _        t          j        ˆfd„t          ‰j        ¦  «        D ¦   «         ¦  «        | _        d S )Nc                 ó2   •— g | ]}t          ‰|¬ ¦  «        ‘ŒS ))r�   )rä   )Ú.0ÚirL   s     €rN   ú
<listcomp>z-CamembertEncoder.__init__.<locals>.<listcomp>
  s&   ø€ Ð#qÐ#qÐ#qÈA¥N°6ÀQÐ$GÑ$GÔ$GÐ#qÐ#qÐ#qrO   )r2   r3   rL   r4   Ú
ModuleListÚrangeÚnum_hidden_layersÚlayerrJ   s    `€rN   r3   zCamembertEncoder.__init__  sX   øø€ Ý‰Œ×ÒÑÔÐØˆŒÝ”]Ð#qÐ#qÐ#qÐ#qÕQVÐW]ÔWoÑQpÔQpÐ#qÑ#qÔ#qÑrÔrˆŒ
ˆ
ˆ
rO   NrŸ   r   r¶   rÓ   r    Ú	use_cacher�   rS   c                 ó|   — t          | j        ¦  «        D ]\  }}	 |	|||f||dœ|¤Ž}Œt          ||r|nd ¬¦  «        S )N)rÓ   r    )Úlast_hidden_stater    )Ú	enumerater  r   )
rK   rŸ   r   r¶   rÓ   r    r  r�   r  Úlayer_modules
             rN   rd   zCamembertEncoder.forward  s�   € õ  )¨¬Ñ4Ô4ð 	ð 	‰OˆAˆ|Ø(˜LØØØ%ðð (>Ø /ðð ð ðð ˆMˆMõ 9Ø+Ø/8ÐB˜O˜O¸dð
ñ 
ô 
ð 	
rO   )NNNNN)rp   rq   rr   r3   rB   rv   ru   r   Úboolr   r   r²   r   rd   rx   ry   s   @rN   r  r    sê   ø€ € € € € ðsð sð sð sð sð 48Ø:>Ø;?Ø(,Ø!%ð
ð 
à”|ð
ð Ô)¨DÑ0ð
ð  %Ô0°4Ñ7ð	
ð
 !&Ô 1°DÑ 8ð
ð  ™ð
ð ˜$‘;ð
ð Ð+Ô,ð
ð 
ˆuŒ|Ô	ÐHÑ	Hð
ð 
ð 
ð 
ð 
ð 
ð 
ð 
rO   r  c                   óB   ‡ — e Zd Zˆ fd„Zdej        dej        fd„Zˆ xZS )ÚCamembertPoolerc                 óÀ   •— t          ¦   «                              ¦   «          t          j        |j        |j        ¦  «        | _        t          j        ¦   «         | _        d S rÆ   )r2   r3   r4   r™   r7   rÃ   ÚTanhÚ
activationrJ   s     €rN   r3   zCamembertPooler.__init__'  sC   ø€ Ý‰Œ×ÒÑÔÐÝ”Y˜vÔ1°6Ô3EÑFÔFˆŒ
Ýœ'™)œ)ˆŒˆˆrO   rŸ   rS   c                 ór   — |d d …df         }|                       |¦  «        }|                      |¦  «        }|S ©Nr   )rÃ   r(  )rK   rŸ   Úfirst_token_tensorÚpooled_outputs       rN   rd   zCamembertPooler.forward,  s@   € ð +¨1¨1¨1¨a¨4Ô0ÐØŸ
š
Ð#5Ñ6Ô6ˆØŸš¨Ñ6Ô6ˆØÐrO   rÊ   ry   s   @rN   r%  r%  &  s^   ø€ € € € € ð$ð $ð $ð $ð $ð
 U¤\ð °e´lð ð ð ð ð ð ð ð rO   r%  a
  
    The model can behave as an encoder (with only self-attention) as well as a decoder, in which case a layer of
    cross-attention is added between the self-attention layers, following the architecture described in [Attention is
    all you need](https://huggingface.co/papers/1706.03762) by Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit,
    Llion Jones, Aidan N. Gomez, Lukasz Kaiser and Illia Polosukhin.

    To behave as an decoder the model needs to be initialized with the `is_decoder` argument of the configuration set
    to `True`. To be used in a Seq2Seq model, the model needs to initialized with both `is_decoder` argument and
    `add_cross_attention` set to `True`; an `encoder_hidden_states` is then expected as an input to the forward pass.
    )Úcustom_introc                   óV  ‡ — e Zd ZddgZdˆ fd„	Zd„ Zd„ Zeee		 	 	 	 	 	 	 	 	 dde
j        dz  d	e
j        dz  d
e
j        dz  de
j        dz  de
j        dz  de
j        dz  de
j        dz  dedz  dedz  dee         dee
j                 ez  fd„¦   «         ¦   «         ¦   «         Zd„ Zˆ xZS )ÚCamembertModelr'   rä   Tc                 ó  •— t          ¦   «                              |¦  «         || _        d| _        t	          |¦  «        | _        t          |¦  «        | _        |rt          |¦  «        nd| _	        |  
                    ¦   «          dS )zv
        add_pooling_layer (bool, *optional*, defaults to `True`):
            Whether to add a pooling layer
        FN)r2   r3   rL   Úgradient_checkpointingr'   rc   r  Úencoderr%  ÚpoolerÚ	post_init)rK   rL   Úadd_pooling_layerrM   s      €rN   r3   zCamembertModel.__init__D  s{   ø€ õ
 	‰Œ×Ò˜Ñ Ô Ð ØˆŒØ&+ˆÔ#å-¨fÑ5Ô5ˆŒÝ'¨Ñ/Ô/ˆŒà1BÐL•o fÑ-Ô-Ð-ÈˆŒð 	�ŠÑÔÐÐÐrO   c                 ó   — | j         j        S rÆ   ©rc   r9   ©rK   s    rN   Úget_input_embeddingsz#CamembertModel.get_input_embeddingsU  s   € ØŒÔ.Ð.rO   c                 ó   — || j         _        d S rÆ   r7  )rK   r~   s     rN   Úset_input_embeddingsz#CamembertModel.set_input_embeddingsX  s   € Ø*/ˆŒÔ'Ð'Ð'rO   NrP   r   r0   r,   rQ   r¶   rÓ   r    r  r�   rS   c
           
      ój  — |d u |d uz  rt          d¦  «        ‚| j        j        r|	�|	n| j        j        }	nd}	|	r[|€Y|€| j        j        r6t          t          | j        ¬¦  «        t          | j        ¬¦  «        ¦  «        nt          | j        ¬¦  «        }|�|                     ¦   «         nd}|                      |||||¬¦  «        }|  	                    |||||¬¦  «        \  }} | j
        |f|||||	|dœ|
¤Ž}|j        }| j        �|                      |¦  «        nd }t          |||j        ¬¦  «        S )	Nz:You must specify exactly one of input_ids or inputs_embedsF)rL   r   )rP   r,   r0   rQ   rR   )r   rÓ   Úembedding_outputr¶   r    )r   r¶   rÓ   r    r  r,   )r   Úpooler_outputr    )r–   rL   r›   r  Úis_encoder_decoderr   r   Úget_seq_lengthrc   Ú_create_attention_masksr2  r   r3  r   r    )rK   rP   r   r0   r,   rQ   r¶   rÓ   r    r  r�   rR   r=  Úencoder_outputsÚsequence_outputr,  s                   rN   rd   zCamembertModel.forward[  s¸  € ð  ˜Ð -°tÐ";Ñ<ð 	[ÝÐYÑZÔZÐZàŒ;Ô!ð 	Ø%.Ð%:˜	˜	ÀÄÔ@UˆIˆIàˆIàð 	˜Ð0ð )Ð4¸¼Ô8VÐ4õ $¥L¸¼Ð$DÑ$DÔ$DÅlÐZ^ÔZeÐFfÑFfÔFfÑgÔgÐgå!¨¬Ð5Ñ5Ô5ð ð FUÐE` ×!?Ò!?Ñ!AÔ!AÐ!AÐfgÐàŸ?š?ØØ%Ø)Ø'Ø#9ð +ñ 
ô 
Ðð 26×1MÒ1MØ)Ø#9Ø-Ø"7Ø+ð 2Nñ 2
ô 2
Ñ.ˆÐ.ð '˜$œ,Øð	
à)Ø"7Ø#9Ø+ØØ%ð	
ð 	
ð ð	
ð 	
ˆð *Ô;ˆØ8<¼Ð8O˜Ÿš OÑ4Ô4Ð4ÐUYˆå;Ø-Ø'Ø+Ô;ð
ñ 
ô 
ð 	
rO   c                 ó¶   — | j         j        rt          | j         |||¬¦  «        }nt          | j         ||¬¦  «        }|�t          | j         |||¬¦  «        }||fS )N)rL   rQ   r   r    )rL   rQ   r   )rL   rQ   r   r¶   )rL   r›   r   r   )rK   r   rÓ   r=  r¶   r    s         rN   rA  z&CamembertModel._create_attention_masksŸ  s�   € ð Œ;Ô!ð 	Ý/Ø”{Ø.Ø-Ø /ð	ñ ô ˆNˆNõ 7Ø”{Ø.Ø-ðñ ô ˆNð "Ð-Ý%>Ø”{Ø.Ø5Ø&;ð	&ñ &ô &Ð"ð Ð5Ð5Ð5rO   )T)	NNNNNNNNN)rp   rq   rr   Ú_no_split_modulesr3   r9  r;  r"   r#   r   rB   rv   r   r#  r   r   r²   r   rd   rA  rx   ry   s   @rN   r/  r/  5  sˆ  ø€ € € € € ð /Ð0@ÐAÐðð ð ð ð ð ð"/ð /ð /ð0ð 0ð 0ð  ØØð *.Ø.2Ø.2Ø,0Ø-1Ø59Ø6:Ø(,Ø!%ð?
ð ?
à”< $Ñ&ð?
ð œ tÑ+ð?
ð œ tÑ+ð	?
ð
 ”l TÑ)ð?
ð ”| dÑ*ð?
ð  %œ|¨dÑ2ð?
ð !&¤¨tÑ 3ð?
ð  ™ð?
ð ˜$‘;ð?
ð Ð+Ô,ð?
ð 
ˆuŒ|Ô	ÐKÑ	Kð?
ð ?
ð ?
ñ „^ñ „_ñ  Ôð?
ðB6ð 6ð 6ð 6ð 6ð 6ð 6rO   r/  c                   ó>  ‡ — e Zd ZdddœZˆ fd„Zd„ Zd„ Zee	 	 	 	 	 	 	 	 dde	j
        dz  d	e	j        dz  d
e	j
        dz  de	j
        dz  de	j        dz  de	j        dz  de	j        dz  de	j
        dz  dee         dee	j                 ez  fd„¦   «         ¦   «         Zˆ xZS )ÚCamembertForMaskedLMú)roberta.embeddings.word_embeddings.weightúlm_head.bias©zlm_head.decoder.weightzlm_head.decoder.biasc                 ó  •— t          ¦   «                              |¦  «         |j        rt                               d¦  «         t          |¦  «        | _        t          |d¬¦  «        | _        |  	                    ¦   «          d S )NzpIf you want to use `CamembertForMaskedLM` make sure `config.is_decoder=False` for bi-directional self-attention.F©r5  ©
r2   r3   r›   ÚloggerÚwarningrõ   Úlm_headr/  r  r4  rJ   s     €rN   r3   zCamembertForMaskedLM.__init__Ç  s~   ø€ Ý‰Œ×Ò˜Ñ Ô Ð àÔð 	Ý�NŠNð1ñô ð õ ' vÑ.Ô.ˆŒå% fÀÐFÑFÔFˆŒð 	�ŠÑÔÐÐÐrO   c                 ó   — | j         j        S rÆ   ©rP  rø   r8  s    rN   Úget_output_embeddingsz*CamembertForMaskedLM.get_output_embeddingsÖ  ó   € ØŒ|Ô#Ð#rO   c                 ó   — || j         _        d S rÆ   rR  ©rK   Únew_embeddingss     rN   Úset_output_embeddingsz*CamembertForMaskedLM.set_output_embeddingsÙ  ó   € Ø-ˆŒÔÐÐrO   NrP   r   r0   r,   rQ   r¶   rÓ   Úlabelsr�   rS   c	                 ót  —  | j         |f||||||ddœ|	¤Ž}
|
d         }|                      |¦  «        }d}|�e|                     |j        ¦  «        }t	          ¦   «         } ||                     d| j        j        ¦  «        |                     d¦  «        ¦  «        }t          |||
j	        |
j
        ¬¦  «        S )aô  
        token_type_ids (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Segment token indices to indicate first and second portions of the inputs. Indices are selected in `[0,1]`:

            - 0 corresponds to a *sentence A* token,
            - 1 corresponds to a *sentence B* token.
            This parameter can only be used when the model is initialized with `type_vocab_size` parameter with value
            >= 2. All the value in this tensor should be always < type_vocab_size.

            [What are token type IDs?](../glossary#token-type-ids)
        labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Labels for computing the masked language modeling loss. Indices should be in `[-100, 0, ...,
            config.vocab_size]` (see `input_ids` docstring) Tokens with indices set to `-100` are ignored (masked), the
            loss is only computed for the tokens with labels in `[0, ..., config.vocab_size]`
        T)r   r0   r,   rQ   r¶   rÓ   Úreturn_dictr   Nr.   ©ÚlossÚlogitsrŸ   r  )r  rP  r\   rX   r   r£   rL   r6   r   rŸ   r  )rK   rP   r   r0   r,   rQ   r¶   rÓ   rZ  r�   ÚoutputsrC  Úprediction_scoresÚmasked_lm_lossÚloss_fcts                  rN   rd   zCamembertForMaskedLM.forwardÜ  së   € ð: �$”,Øð

à)Ø)Ø%Ø'Ø"7Ø#9Øð

ð 

ð ð

ð 

ˆð " !œ*ˆØ ŸLšL¨Ñ9Ô9ÐàˆØÐà—Y’YÐ0Ô7Ñ8Ô8ˆFÝ'Ñ)Ô)ˆHØ%˜XÐ&7×&<Ò&<¸RÀÄÔAWÑ&XÔ&XÐZ`×ZeÒZeÐfhÑZiÔZiÑjÔjˆNåØØ$Ø!Ô/ØÔ)ð	
ñ 
ô 
ð 	
rO   )NNNNNNNN)rp   rq   rr   Ú_tied_weights_keysr3   rS  rX  r!   r   rB   rt   ru   r   r   r²   rv   r   rd   rx   ry   s   @rN   rG  rG  À  sj  ø€ € € € € ð #NØ .ðð Ðð
ð ð ð ð ð$ð $ð $ð.ð .ð .ð Øð .2Ø37Ø26Ø04Ø26Ø:>Ø;?Ø*.ð5
ð 5
àÔ# dÑ*ð5
ð Ô)¨DÑ0ð5
ð Ô(¨4Ñ/ð	5
ð
 Ô&¨Ñ-ð5
ð Ô(¨4Ñ/ð5
ð  %Ô0°4Ñ7ð5
ð !&Ô 1°DÑ 8ð5
ð Ô  4Ñ'ð5
ð Ð+Ô,ð5
ð 
ˆuŒ|Ô	˜~Ñ	-ð5
ð 5
ð 5
ñ „^ñ Ôð5
ð 5
ð 5
ð 5
ð 5
rO   rG  c                   ó(   ‡ — e Zd ZdZˆ fd„Zd„ Zˆ xZS )ÚCamembertClassificationHeadz-Head for sentence-level classification tasks.c                 ó4  •— t          ¦   «                              ¦   «          t          j        |j        |j        ¦  «        | _        |j        �|j        n|j        }t          j        |¦  «        | _	        t          j        |j        |j
        ¦  «        | _        d S rÆ   )r2   r3   r4   r™   r7   rÃ   Úclassifier_dropoutr?   r>   r@   Ú
num_labelsÚout_proj©rK   rL   rh  rM   s      €rN   r3   z$CamembertClassificationHead.__init__  s   ø€ Ý‰Œ×ÒÑÔÐÝ”Y˜vÔ1°6Ô3EÑFÔFˆŒ
à)/Ô)BÐ)NˆFÔ%Ð%ÐTZÔTnð 	õ ”zÐ"4Ñ5Ô5ˆŒÝœ	 &Ô"4°fÔ6GÑHÔHˆŒˆˆrO   c                 óô   — |d d …dd d …f         }|                       |¦  «        }|                      |¦  «        }t          j        |¦  «        }|                       |¦  «        }|                      |¦  «        }|S r*  )r@   rÃ   rB   Útanhrj  rü   s       rN   rd   z#CamembertClassificationHead.forward"  sj   € Ø�Q�Q�Q˜˜1˜1˜1�WÔˆØ�LŠL˜‰OŒOˆØ�JŠJ�q‰MŒMˆÝŒJ�q‰MŒMˆØ�LŠL˜‰OŒOˆØ�MŠM˜!ÑÔˆØˆrO   rÿ   ry   s   @rN   rf  rf    sR   ø€ € € € € Ø7Ð7ðIð Ið Ið Ið Iðð ð ð ð ð ð rO   rf  z¡
    Camembert Model transformer with a sequence classification/regression head on top (a linear layer on top of the
    pooled output) e.g. for GLUE tasks.
    c                   óü   ‡ — e Zd Zˆ fd„Zee	 	 	 	 	 	 ddej        dz  dej        dz  dej        dz  dej        dz  dej        dz  dej        dz  d	e	e
         d
eej                 ez  fd„¦   «         ¦   «         Zˆ xZS )Ú"CamembertForSequenceClassificationc                 óì   •— t          ¦   «                              |¦  «         |j        | _        || _        t	          |¦  «        | _        t          |d¬¦  «        | _        |                      ¦   «          d S ©NFrL  )	r2   r3   ri  rL   rf  Ú
classifierr/  r  r4  rJ   s     €rN   r3   z+CamembertForSequenceClassification.__init__3  sg   ø€ Ý‰Œ×Ò˜Ñ Ô Ð Ø Ô+ˆŒØˆŒÝ5°fÑ=Ô=ˆŒå% fÀÐFÑFÔFˆŒð 	�ŠÑÔÐÐÐrO   NrP   r   r0   r,   rQ   rZ  r�   rS   c           	      ó�  —  | j         |f||||ddœ|¤Ž}|d         }	|                      |	¦  «        }
d}|��t|                     |
j        ¦  «        }| j        j        €f| j        dk    rd| j        _        nN| j        dk    r7|j        t          j	        k    s|j        t          j
        k    rd| j        _        nd| j        _        | j        j        dk    rWt          ¦   «         }| j        dk    r1 ||
                     ¦   «         |                     ¦   «         ¦  «        }nŽ ||
|¦  «        }n�| j        j        dk    rGt          ¦   «         } ||
                     d	| j        ¦  «        |                     d	¦  «        ¦  «        }n*| j        j        dk    rt          ¦   «         } ||
|¦  «        }t!          ||
|j        |j        ¬
¦  «        S )aß  
        token_type_ids (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Segment token indices to indicate first and second portions of the inputs. Indices are selected in `[0,1]`:

            - 0 corresponds to a *sentence A* token,
            - 1 corresponds to a *sentence B* token.
            This parameter can only be used when the model is initialized with `type_vocab_size` parameter with value
            >= 2. All the value in this tensor should be always < type_vocab_size.

            [What are token type IDs?](../glossary#token-type-ids)
        labels (`torch.LongTensor` of shape `(batch_size,)`, *optional*):
            Labels for computing the sequence classification/regression loss. Indices should be in `[0, ...,
            config.num_labels - 1]`. If `config.num_labels == 1` a regression loss is computed (Mean-Square loss), If
            `config.num_labels > 1` a classification loss is computed (Cross-Entropy).
        T©r   r0   r,   rQ   r\  r   Nr$   Ú
regressionÚsingle_label_classificationÚmulti_label_classificationr.   r]  )r  rr  r\   rX   rL   Úproblem_typeri  r1   rB   rH   rk   r   Úsqueezer   r£   r   r   rŸ   r  ©rK   rP   r   r0   r,   rQ   rZ  r�   r`  rC  r_  r^  rc  s                rN   rd   z*CamembertForSequenceClassification.forward>  sÝ  € ð6 �$”,Øð
à)Ø)Ø%Ø'Øð
ð 
ð ð
ð 
ˆð " !œ*ˆØ—’ Ñ1Ô1ˆàˆØÑà—Y’Y˜vœ}Ñ-Ô-ˆFØŒ{Ô'Ð/Ø”? aÒ'Ð'Ø/;�D”KÔ,Ð,Ø”_ qÒ(Ð(¨f¬l½e¼jÒ.HÐ.HÈFÌLÕ\aÔ\eÒLeÐLeØ/L�D”KÔ,Ð,à/K�D”KÔ,àŒ{Ô'¨<Ò7Ð7Ý"™9œ9�Ø”? aÒ'Ð'Ø#˜8 F§N¢NÑ$4Ô$4°f·n²nÑ6FÔ6FÑGÔG�D�Dà#˜8 F¨FÑ3Ô3�D�DØ”Ô)Ð-JÒJÐJÝ+Ñ-Ô-�Ø�x §¢¨B°´Ñ @Ô @À&Ç+Â+ÈbÁ/Ä/ÑRÔR��Ø”Ô)Ð-IÒIÐIÝ,Ñ.Ô.�Ø�x ¨Ñ/Ô/�å'ØØØ!Ô/ØÔ)ð	
ñ 
ô 
ð 	
rO   ©NNNNNN)rp   rq   rr   r3   r!   r   rB   rt   ru   r   r   r²   rv   r   rd   rx   ry   s   @rN   ro  ro  ,  s  ø€ € € € € ð	ð 	ð 	ð 	ð 	ð Øð .2Ø37Ø26Ø04Ø26Ø*.ðC
ð C
àÔ# dÑ*ðC
ð Ô)¨DÑ0ðC
ð Ô(¨4Ñ/ð	C
ð
 Ô&¨Ñ-ðC
ð Ô(¨4Ñ/ðC
ð Ô  4Ñ'ðC
ð Ð+Ô,ðC
ð 
ˆuŒ|Ô	Ð7Ñ	7ðC
ð C
ð C
ñ „^ñ ÔðC
ð C
ð C
ð C
ð C
rO   ro  c                   óü   ‡ — e Zd Zˆ fd„Zee	 	 	 	 	 	 ddej        dz  dej        dz  dej        dz  dej        dz  dej        dz  dej        dz  d	e	e
         d
eej                 ez  fd„¦   «         ¦   «         Zˆ xZS )ÚCamembertForMultipleChoicec                 ó  •— t          ¦   «                              |¦  «         t          j        |j        ¦  «        | _        t          j        |j        d¦  «        | _        t          |d¬¦  «        | _
        |                      ¦   «          d S )Nr$   TrL  )r2   r3   r4   r>   r?   r@   r™   r7   rr  r/  r  r4  rJ   s     €rN   r3   z#CamembertForMultipleChoice.__init__ˆ  sq   ø€ Ý‰Œ×Ò˜Ñ Ô Ð Ý”z &Ô"<Ñ=Ô=ˆŒÝœ) FÔ$6¸Ñ:Ô:ˆŒå% fÀÐEÑEÔEˆŒð 	�ŠÑÔÐÐÐrO   NrP   r0   r   rZ  r,   rQ   r�   rS   c           	      ó†  — |�|j         d         n|j         d         }|�)|                     d|                     d¦  «        ¦  «        nd}	|�)|                     d|                     d¦  «        ¦  «        nd}
|�)|                     d|                     d¦  «        ¦  «        nd}|�)|                     d|                     d¦  «        ¦  «        nd}|�=|                     d|                     d¦  «        |                     d¦  «        ¦  «        nd} | j        |	f|
|||ddœ|¤Ž}|d         }|                      |¦  «        }|                      |¦  «        }|                     d|¦  «        }d}|�4|                     |j        ¦  «        }t          ¦   «         } |||¦  «        }t          |||j
        |j        ¬¦  «        S )a  
        input_ids (`torch.LongTensor` of shape `(batch_size, num_choices, sequence_length)`):
            Indices of input sequence tokens in the vocabulary.

            Indices can be obtained using [`AutoTokenizer`]. See [`PreTrainedTokenizer.encode`] and
            [`PreTrainedTokenizer.__call__`] for details.

            [What are input IDs?](../glossary#input-ids)
        token_type_ids (`torch.LongTensor` of shape `(batch_size, num_choices, sequence_length)`, *optional*):
            Segment token indices to indicate first and second portions of the inputs. Indices are selected in `[0,1]`:

            - 0 corresponds to a *sentence A* token,
            - 1 corresponds to a *sentence B* token.
            This parameter can only be used when the model is initialized with `type_vocab_size` parameter with value
            >= 2. All the value in this tensor should be always < type_vocab_size.

            [What are token type IDs?](../glossary#token-type-ids)
        labels (`torch.LongTensor` of shape `(batch_size,)`, *optional*):
            Labels for computing the multiple choice classification loss. Indices should be in `[0, ...,
            num_choices-1]` where `num_choices` is the size of the second dimension of the input tensors. (See
            `input_ids` above)
        position_ids (`torch.LongTensor` of shape `(batch_size, num_choices, sequence_length)`, *optional*):
            Indices of positions of each input sequence tokens in the position embeddings. Selected in the range `[0,
            config.max_position_embeddings - 1]`.

            [What are position IDs?](../glossary#position-ids)
        inputs_embeds (`torch.FloatTensor` of shape `(batch_size, num_choices, sequence_length, hidden_size)`, *optional*):
            Optionally, instead of passing `input_ids` you can choose to directly pass an embedded representation. This
            is useful if you want more control over how to convert `input_ids` indices into associated vectors than the
            model's internal embedding lookup matrix.
        Nr$   r.   éþÿÿÿT)r,   r0   r   rQ   r\  r]  )r]   r£   rG   r  r@   rr  r\   rX   r   r   rŸ   r  )rK   rP   r0   r   rZ  r,   rQ   r�   Únum_choicesÚflat_input_idsÚflat_position_idsÚflat_token_type_idsÚflat_attention_maskÚflat_inputs_embedsr`  r,  r_  Úreshaped_logitsr^  rc  s                       rN   rd   z"CamembertForMultipleChoice.forward’  s   € ðV -6Ð,A�i”o aÔ(Ð(À}ÔGZÐ[\ÔG]ˆàCLÐCX˜Ÿš¨¨I¯NªN¸2Ñ,>Ô,>Ñ?Ô?Ð?Ð^bˆØLXÐLd˜L×-Ò-¨b°,×2CÒ2CÀBÑ2GÔ2GÑHÔHÐHÐjnÐØR`ÐRl˜n×1Ò1°"°n×6IÒ6IÈ"Ñ6MÔ6MÑNÔNÐNÐrvÐØR`ÐRl˜n×1Ò1°"°n×6IÒ6IÈ"Ñ6MÔ6MÑNÔNÐNÐrvÐð Ð(ð ×Ò˜r =×#5Ò#5°bÑ#9Ô#9¸=×;MÒ;MÈbÑ;QÔ;QÑRÔRÐRàð 	ð �$”,Øð
à*Ø.Ø.Ø,Øð
ð 
ð ð
ð 
ˆð   œ
ˆàŸš ]Ñ3Ô3ˆØ—’ Ñ/Ô/ˆØ Ÿ+š+ b¨+Ñ6Ô6ˆàˆØÐà—Y’Y˜Ô5Ñ6Ô6ˆFÝ'Ñ)Ô)ˆHØ�8˜O¨VÑ4Ô4ˆDå(ØØ"Ø!Ô/ØÔ)ð	
ñ 
ô 
ð 	
rO   r{  )rp   rq   rr   r3   r!   r   rB   rt   ru   r   r   r²   rv   r   rd   rx   ry   s   @rN   r}  r}  †  s  ø€ € € € € ðð ð ð ð ð Øð .2Ø26Ø37Ø*.Ø04Ø26ðP
ð P
àÔ# dÑ*ðP
ð Ô(¨4Ñ/ðP
ð Ô)¨DÑ0ð	P
ð
 Ô  4Ñ'ðP
ð Ô&¨Ñ-ðP
ð Ô(¨4Ñ/ðP
ð Ð+Ô,ðP
ð 
ˆuŒ|Ô	Ð8Ñ	8ðP
ð P
ð P
ñ „^ñ ÔðP
ð P
ð P
ð P
ð P
rO   r}  c                   óü   ‡ — e Zd Zˆ fd„Zee	 	 	 	 	 	 ddej        dz  dej        dz  dej        dz  dej        dz  dej        dz  dej        dz  d	e	e
         d
eej                 ez  fd„¦   «         ¦   «         Zˆ xZS )ÚCamembertForTokenClassificationc                 óZ  •— t          ¦   «                              |¦  «         |j        | _        |j        �|j        n|j        }t          j        |¦  «        | _        t          j        |j	        |j        ¦  «        | _
        t          |d¬¦  «        | _        |                      ¦   «          d S rq  )r2   r3   ri  rh  r?   r4   r>   r@   r™   r7   rr  r/  r  r4  rk  s      €rN   r3   z(CamembertForTokenClassification.__init__é  sš   ø€ Ý‰Œ×Ò˜Ñ Ô Ð Ø Ô+ˆŒà)/Ô)BÐ)NˆFÔ%Ð%ÐTZÔTnð 	õ ”zÐ"4Ñ5Ô5ˆŒÝœ) FÔ$6¸Ô8IÑJÔJˆŒå% fÀÐFÑFÔFˆŒð 	�ŠÑÔÐÐÐrO   NrP   r   r0   r,   rQ   rZ  r�   rS   c           	      ó�  —  | j         |f||||ddœ|¤Ž}|d         }	|                      |	¦  «        }	|                      |	¦  «        }
d}|�`|                     |
j        ¦  «        }t          ¦   «         } ||
                     d| j        ¦  «        |                     d¦  «        ¦  «        }t          ||
|j	        |j
        ¬¦  «        S )a-  
        token_type_ids (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Segment token indices to indicate first and second portions of the inputs. Indices are selected in `[0,1]`:

            - 0 corresponds to a *sentence A* token,
            - 1 corresponds to a *sentence B* token.
            This parameter can only be used when the model is initialized with `type_vocab_size` parameter with value
            >= 2. All the value in this tensor should be always < type_vocab_size.

            [What are token type IDs?](../glossary#token-type-ids)
        labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Labels for computing the token classification loss. Indices should be in `[0, ..., config.num_labels - 1]`.
        Trt  r   Nr.   r]  )r  r@   rr  r\   rX   r   r£   ri  r   rŸ   r  rz  s                rN   rd   z'CamembertForTokenClassification.forward÷  sç   € ð2 �$”,Øð
à)Ø)Ø%Ø'Øð
ð 
ð ð
ð 
ˆð " !œ*ˆàŸ,š, Ñ7Ô7ˆØ—’ Ñ1Ô1ˆàˆØÐà—Y’Y˜vœ}Ñ-Ô-ˆFÝ'Ñ)Ô)ˆHØ�8˜FŸKšK¨¨D¬OÑ<Ô<¸f¿kºkÈ"¹o¼oÑNÔNˆDå$ØØØ!Ô/ØÔ)ð	
ñ 
ô 
ð 	
rO   r{  )rp   rq   rr   r3   r!   r   rB   rt   ru   r   r   r²   rv   r   rd   rx   ry   s   @rN   r‰  r‰  ç  s  ø€ € € € € ðð ð ð ð ð Øð .2Ø37Ø26Ø04Ø26Ø*.ð2
ð 2
àÔ# dÑ*ð2
ð Ô)¨DÑ0ð2
ð Ô(¨4Ñ/ð	2
ð
 Ô&¨Ñ-ð2
ð Ô(¨4Ñ/ð2
ð Ô  4Ñ'ð2
ð Ð+Ô,ð2
ð 
ˆuŒ|Ô	Ð4Ñ	4ð2
ð 2
ð 2
ñ „^ñ Ôð2
ð 2
ð 2
ð 2
ð 2
rO   r‰  c                   ó  ‡ — e Zd Zˆ fd„Zee	 	 	 	 	 	 	 ddej        dz  dej        dz  dej        dz  dej        dz  dej        dz  dej        dz  d	ej        dz  d
e	e
         deej                 ez  fd„¦   «         ¦   «         Zˆ xZS )ÚCamembertForQuestionAnsweringc                 óþ   •— t          ¦   «                              |¦  «         |j        | _        t          j        |j        |j        ¦  «        | _        t          |d¬¦  «        | _        |  	                    ¦   «          d S rq  )
r2   r3   ri  r4   r™   r7   Ú
qa_outputsr/  r  r4  rJ   s     €rN   r3   z&CamembertForQuestionAnswering.__init__0  sj   ø€ Ý‰Œ×Ò˜Ñ Ô Ð Ø Ô+ˆŒÝœ) FÔ$6¸Ô8IÑJÔJˆŒå% fÀÐFÑFÔFˆŒð 	�ŠÑÔÐÐÐrO   NrP   r   r0   r,   rQ   Ústart_positionsÚend_positionsr�   rS   c           	      óF  —  | j         |f||||ddœ|¤Ž}	|	d         }
|                      |
¦  «        }|                     dd¬¦  «        \  }}|                     d¦  «                             ¦   «         }|                     d¦  «                             ¦   «         }d}|�ç|�åt          |                     ¦   «         ¦  «        dk    r|                     d¦  «        }t          |                     ¦   «         ¦  «        dk    r|                     d¦  «        }|                     d¦  «        }|                     d|¦  «        }|                     d|¦  «        }t          |¬¦  «        } |||¦  «        } |||¦  «        }||z   d	z  }t          ||||	j
        |	j        ¬
¦  «        S )a[  
        token_type_ids (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Segment token indices to indicate first and second portions of the inputs. Indices are selected in `[0,1]`:

            - 0 corresponds to a *sentence A* token,
            - 1 corresponds to a *sentence B* token.
            This parameter can only be used when the model is initialized with `type_vocab_size` parameter with value
            >= 2. All the value in this tensor should be always < type_vocab_size.

            [What are token type IDs?](../glossary#token-type-ids)
        Trt  r   r$   r.   ri   N)Úignore_indexr„   )r^  Ústart_logitsÚ
end_logitsrŸ   r  )r  r�  Úsplitry  r‹   ÚlenrG   Úclampr   r   rŸ   r  )rK   rP   r   r0   r,   rQ   r�  r‘  r�   r`  rC  r_  r”  r•  Ú
total_lossÚignored_indexrc  Ú
start_lossÚend_losss                      rN   rd   z%CamembertForQuestionAnswering.forward:  sÏ  € ð0 �$”,Øð
à)Ø)Ø%Ø'Øð
ð 
ð ð
ð 
ˆð " !œ*ˆà—’ Ñ1Ô1ˆØ#)§<¢<°°r <Ñ#:Ô#:Ñ ˆ�jØ#×+Ò+¨BÑ/Ô/×:Ò:Ñ<Ô<ˆØ×'Ò'¨Ñ+Ô+×6Ò6Ñ8Ô8ˆ
àˆ
ØÐ&¨=Ð+Då�?×'Ò'Ñ)Ô)Ñ*Ô*¨QÒ.Ð.Ø"1×"9Ò"9¸"Ñ"=Ô"=�Ý�=×%Ò%Ñ'Ô'Ñ(Ô(¨1Ò,Ð,Ø -× 5Ò 5°bÑ 9Ô 9�à(×-Ò-¨aÑ0Ô0ˆMØ-×3Ò3°A°}ÑEÔEˆOØ)×/Ò/°°=ÑAÔAˆMå'°]ÐCÑCÔCˆHØ!˜ ,°Ñ@Ô@ˆJØ�x 
¨MÑ:Ô:ˆHØ$ xÑ/°1Ñ4ˆJå+ØØ%Ø!Ø!Ô/ØÔ)ð
ñ 
ô 
ð 	
rO   )NNNNNNN)rp   rq   rr   r3   r!   r   rB   rt   ru   r   r   r²   rv   r   rd   rx   ry   s   @rN   r�  r�  .  s"  ø€ € € € € ðð ð ð ð ð Øð .2Ø37Ø26Ø04Ø26Ø37Ø15ð>
ð >
àÔ# dÑ*ð>
ð Ô)¨DÑ0ð>
ð Ô(¨4Ñ/ð	>
ð
 Ô&¨Ñ-ð>
ð Ô(¨4Ñ/ð>
ð Ô)¨DÑ0ð>
ð Ô'¨$Ñ.ð>
ð Ð+Ô,ð>
ð 
ˆuŒ|Ô	Ð;Ñ	;ð>
ð >
ð >
ñ „^ñ Ôð>
ð >
ð >
ð >
ð >
rO   r�  zU
    Camembert Model with a `language modeling` head on top for CLM fine-tuning.
    c                   óŽ  ‡ — e Zd ZdddœZˆ fd„Zd„ Zd„ Zee	 	 	 	 	 	 	 	 	 	 	 dd	e	j
        dz  d
e	j        dz  de	j
        dz  de	j
        dz  de	j        dz  de	j        dz  de	j        dz  de	j
        dz  deee	j                          dz  dedz  dee	j        z  dee         dee	j                 ez  fd„¦   «         ¦   «         Zˆ xZS )ÚCamembertForCausalLMrH  rI  rJ  c                 ó  •— t          ¦   «                              |¦  «         |j        st                               d¦  «         t          |¦  «        | _        t          |d¬¦  «        | _        |  	                    ¦   «          d S )NzQIf you want to use `CamembertLMHeadModel` as a standalone, add `is_decoder=True.`FrL  rM  rJ   s     €rN   r3   zCamembertForCausalLM.__init__ˆ  su   ø€ Ý‰Œ×Ò˜Ñ Ô Ð àÔ ð 	pÝ�NŠNÐnÑoÔoÐoÝ& vÑ.Ô.ˆŒå% fÀÐFÑFÔFˆŒð 	�ŠÑÔÐÐÐrO   c                 ó   — | j         j        S rÆ   rR  r8  s    rN   rS  z*CamembertForCausalLM.get_output_embeddings”  rT  rO   c                 ó   — || j         _        d S rÆ   rR  rV  s     rN   rX  z*CamembertForCausalLM.set_output_embeddings—  rY  rO   Nr   rP   r   r0   r,   rQ   r¶   rÓ   rZ  r    r  Úlogits_to_keepr�   rS   c                 ól  — |�d}
 | j         |f|||||||	|
ddœ	|¤Ž}|j        }t          |t          ¦  «        rt	          | d¦  «        n|}|                      |dd…|dd…f         ¦  «        }d}|� | j        d||| j        j        dœ|¤Ž}t          |||j
        |j        |j        |j        ¬¦  «        S )aq  
        token_type_ids (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Segment token indices to indicate first and second portions of the inputs. Indices are selected in `[0,1]`:

            - 0 corresponds to a *sentence A* token,
            - 1 corresponds to a *sentence B* token.
            This parameter can only be used when the model is initialized with `type_vocab_size` parameter with value
            >= 2. All the value in this tensor should be always < type_vocab_size.

            [What are token type IDs?](../glossary#token-type-ids)
        labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
            Labels for computing the left-to-right language modeling loss (next word prediction). Indices should be in
            `[-100, 0, ..., config.vocab_size]` (see `input_ids` docstring) Tokens with indices set to `-100` are
            ignored (masked), the loss is only computed for the tokens with labels in `[0, ..., config.vocab_size]`

        Example:

        ```python
        >>> from transformers import AutoTokenizer, CamembertForCausalLM, AutoConfig
        >>> import torch

        >>> tokenizer = AutoTokenizer.from_pretrained("almanach/camembert-base")
        >>> config = AutoConfig.from_pretrained("almanach/camembert-base")
        >>> config.is_decoder = True
        >>> model = CamembertForCausalLM.from_pretrained("almanach/camembert-base", config=config)

        >>> inputs = tokenizer("Hello, my dog is cute", return_tensors="pt")
        >>> outputs = model(**inputs)

        >>> prediction_logits = outputs.logits
        ```NFT)	r   r0   r,   rQ   r¶   rÓ   r    r  r\  )r_  rZ  r6   )r^  r_  r    rŸ   r  r  © )r  r   r¤   rk   ÚslicerP  Úloss_functionrL   r6   r   r    rŸ   r  r  )rK   rP   r   r0   r,   rQ   r¶   rÓ   rZ  r    r  r¢  r�   r`  rŸ   Úslice_indicesr_  r^  s                     rN   rd   zCamembertForCausalLM.forwardš  s  € ð` ÐØˆIà@LÀÄØðA
à)Ø)Ø%Ø'Ø"7Ø#9Ø+ØØðA
ð A
ð ðA
ð A
ˆð  Ô1ˆå8BÀ>ÕSVÑ8WÔ8WÐk�˜~˜o¨tÑ4Ô4Ð4Ð]kˆØ—’˜m¨A¨A¨A¨}¸a¸a¸aÐ,?Ô@ÑAÔAˆàˆØÐØ%�4Ô%Ðp¨V¸FÈtÌ{ÔOeÐpÐpÐioÐpÐpˆDå0ØØØ#Ô3Ø!Ô/ØÔ)Ø$Ô5ð
ñ 
ô 
ð 	
rO   )NNNNNNNNNNr   )rp   rq   rr   rd  r3   rS  rX  r!   r   rB   rt   ru   r²   r#  rk   rv   r   r   r   rd   rx   ry   s   @rN   rž  rž  }  sÅ  ø€ € € € € ð #NØ .ðð Ðð

ð 
ð 
ð 
ð 
ð$ð $ð $ð.ð .ð .ð Øð .2Ø37Ø26Ø04Ø26Ø:>Ø;?Ø*.ØBFØ!%Ø-.ðO
ð O
àÔ# dÑ*ðO
ð Ô)¨DÑ0ðO
ð Ô(¨4Ñ/ð	O
ð
 Ô&¨Ñ-ðO
ð Ô(¨4Ñ/ðO
ð  %Ô0°4Ñ7ðO
ð !&Ô 1°DÑ 8ðO
ð Ô  4Ñ'ðO
ð ˜u UÔ%6Ô7Ô8¸4Ñ?ðO
ð ˜$‘;ðO
ð ˜eœlÑ*ðO
ð Ð+Ô,ðO
ð 
ˆuŒ|Ô	Ð@Ñ	@ðO
ð O
ð O
ñ „^ñ ÔðO
ð O
ð O
ð O
ð O
rO   rž  )rž  rG  r}  r�  ro  r‰  r/  r  )Nrz   )PÚcollections.abcr   rB   Útorch.nnr4   r   r   r   Ú r   r  Úactivationsr	   r
   Úcache_utilsr   r   r   Ú
generationr   Úmasking_utilsr   r   Úmodeling_layersr   Úmodeling_outputsr   r   r   r   r   r   r   r   Úmodeling_utilsr   r   Úprocessing_utilsr   Úpytorch_utilsr   Úutilsr   r   r    Úutils.genericr!   r"   Úutils.output_capturingr#   Úconfiguration_camembertr%   Ú
get_loggerrp   rN  ÚModuler'   rv   ÚfloatrŽ   r�   r´   rÀ   rÍ   rØ   rà   rä   rõ   r  r  r%  r/  rG  rf  ro  r}  r‰  r�  rž  Ú__all__r¤  rO   rN   ú<module>r¼     sñ  ðð, %Ð $Ð $Ð $Ð $Ð $à €€€Ø Ð Ð Ð Ð Ð Ø AÐ AÐ AÐ AÐ AÐ AÐ AÐ AÐ AÐ Aà &Ð &Ð &Ð &Ð &Ð &Ø 'Ð 'Ð 'Ð 'Ð 'Ð 'Ð 'Ð 'Ø CÐ CÐ CÐ CÐ CÐ CÐ CÐ CÐ CÐ CØ )Ð )Ð )Ð )Ð )Ð )Ø JÐ JÐ JÐ JÐ JÐ JÐ JÐ JØ 9Ð 9Ð 9Ð 9Ð 9Ð 9ð	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð 	ð GÐ FÐ FÐ FÐ FÐ FÐ FÐ FØ &Ð &Ð &Ð &Ð &Ð &Ø 6Ð 6Ð 6Ð 6Ð 6Ð 6Ø @Ð @Ð @Ð @Ð @Ð @Ð @Ð @Ð @Ð @Ø IÐ IÐ IÐ IÐ IÐ IÐ IÐ IØ 5Ð 5Ð 5Ð 5Ð 5Ð 5Ø 4Ð 4Ð 4Ð 4Ð 4Ð 4ð 
ˆÔ	˜HÑ	%Ô	%€ðg8ð g8ð g8ð g8ð g8˜"œ)ñ g8ô g8ð g8ð` !Øð%ð %ØŒIð%àŒ<ð%ð 
Œð%ð Œ<ð	%ð
 ”L 4Ñ'ð%ð �T‰\ð%ð ð%ð Ð'Ô(ð%ð %ð %ð %ð8@)ð @)ð @)ð @)ð @)˜RœYñ @)ô @)ð @)ðFI)ð I)ð I)ð I)ð I)˜bœiñ I)ô I)ð I)ðXð ð ð ð ˜"œ)ñ ô ð ð.ð .ð .ð .ð .˜œñ .ô .ð .ð:ð ð ð ð ˜BœIñ ô ð ðð ð ð ð �b”iñ ô ð ð>ð >ð >ð >ð >Ð/ñ >ô >ð >ðBð ð ð ð �b”iñ ô ð ð, ð/ð /ð /ð /ð /˜ñ /ô /ñ „ð/ð2
ð 
ð 
ð 
ð 
�r”yñ 
ô 
ð 
ð@ð ð ð ð �b”iñ ô ð ð €ð	ðñ ô ð|6ð |6ð |6ð |6ð |6Ð-ñ |6ô |6ñô ð|6ð~ ðR
ð R
ð R
ð R
ð R
Ð3ñ R
ô R
ñ „ðR
ðjð ð ð ð  "¤)ñ ô ð ð, €ððñ ô ðQ
ð Q
ð Q
ð Q
ð Q
Ð)Añ Q
ô Q
ñô ðQ
ðh ð]
ð ]
ð ]
ð ]
ð ]
Ð!9ñ ]
ô ]
ñ „ð]
ð@ ðC
ð C
ð C
ð C
ð C
Ð&>ñ C
ô C
ñ „ðC
ðL ðK
ð K
ð K
ð K
ð K
Ð$<ñ K
ô K
ñ „ðK
ð\ €ððñ ô ð
i
ð i
ð i
ð i
ð i
Ð3°_ñ i
ô i
ñô ð
i
ðX	ð 	ð 	€€€rO   