품질을 저하시키지 않고 비용을 줄이는 방법은 무엇입니까? JSON {"tactics": [2개 이상의 기술 목록], "why": "간단히"}를 반환합니다.
AI 호출에는 각 토큰에 대한 비용이 듭니다. 스트림에서는 이것이 제품의 주요 비용 항목입니다. “가장 강력한 모델을 통해 모든 것을 추진한다”는 순진한 계획은 폐허로 변했습니다. 저장 수단: 간단한 작업을 저렴하고 빠른 모델에 지시하고 복잡한 작업을 위해 플래그십을 저장합니다(라우팅). 중복 응답 및 메시지를 캐시합니다. 모델이 확산되지 않도록 max_tokens를 제한하십시오. 프롬프트에서 추가 컨텍스트를 잘라냅니다(각 추가 토큰은 각 요청에 대한 돈입니다). 가능한 경우 그룹 요청(일괄)을 수행합니다. 규칙: 요청의 80%는 일반적으로 단순합니다. 플래그십을 통해 요청을 보내는 것은 낭비입니다. 출시 전 요청 1,000개당 비용을 계산합니다.