Cheat sheetGenerative AIA practical reference for LLMs, prompting, RAG, agents, fine-tuning, evaluation, and production systemsGenerative AIA practical reference for LLMs, prompting, RAG, agents, fine-tuning, evaluation, and production systemsGENERATIVE AI FUNDAMENTALSA high-density reference guide for engineers and technical practitioners working with Generative AI.Key conceptsGenerative AI & Large Language ModelsTokens & Context windowParameters & EmbeddingsAttention & TransformersPretraining & Instruction tuningAlignment & InferenceMental modelInput → tokenization → model inference → generated tokens → post-processingPROMPT ENGINEERINGCore techniquesZero-shot & Few-shot promptingRole & Structured promptingDelimiters & Output constraintsChain-of-thought-aware task designSelf-consistency & Prompt decompositionCritique and refinementRetrieval-augmented promptingPrompt templateRole: You are a [ROLE]. Task: Complete [TASK]. Context: [RELEVANT CONTEXT] Constraints: - [CONSTRAINT 1] - [CONSTRAINT 2] Output format: [EXPECTED FORMAT] Quality requirements: [QUALITY CRITERIA]MODEL SELECTIONReasoning ability & Context lengthLatency & CostMultimodal & Tool calling supportStructured output & PrivacyHosting & Fine-tuning supportDecision patternUse the smallest model that reliably satisfies the task.EMBEDDINGS & VECTOR DATABASESEmbeddings Use CasesSemantic searchRetrieval & ClusteringRecommendationsSimilarity matchingDuplicate detectionVector DatabasesCollections/indexes & VectorsMetadata & Similarity searchFiltering & ANN searchHybrid searchDecisionConsiderationChunk size/overlapContext vs precisionDistance metricCosine vs L2ScaleCloud vs on-premFUNCTION CALLING & TOOL USEUser request → model decides tool → tool invocation → tool result → model responseGood tool definitionClear name & explicit inputsStrict schemaUseful descriptionsError handlingAuthorization checksAI AGENTSObserve → reason/decide → act → observe result → continue/finish<b>Use when:</b> multi-step workflow, dynamic tool usage, needs state/iteration<b>Avoid when:</b> deterministic logic or simple API call sufficesFINE-TUNINGConsider when:Behavior must be highly consistentSpecialized style is requiredRepeated examples existPrompting alone is insufficientDo not use primarily to inject frequently changing knowledge. Prefer retrieval.EVALUATIONEvaluation dimensionsCorrectnessRelevanceFaithfulnessGroundednessHelpfulnessLatencyCostSafetyRAG evaluationRetrieval recall & PrecisionContext relevanceAnswer correctnessCitation accuracyGUARDRAILS & OBSERVABILITYInput/Output validationPrompt injection detection & PII filteringAccess control & Tool authorizationContent moderation & Rate limitingTrack: Request ID, Model, Tokens, Latency, Retrieval results, Errors, Cost.PRODUCTION & MISTAKESProduction ChecklistDefine evaluation datasetEstablish quality thresholdsAdd logging, monitoring, guardrailsSecure secrets & test failuresCommon MistakesUsing LLM instead of deterministic logicSending excessive contextIgnoring retrieval qualityEvaluating only final answersSkipping security testingIgnoring latency and costQUICK DECISION GUIDENeed...Use...Current external knowledge?RAGConsistent specialized behavior?Fine-tuningDynamic API/tool interaction?Tool calling / AgentSemantic search?EmbeddingsPredictable output?Structured outputHigh reliability?Eval & Guardrails