@@ -47,9 +47,9 @@ class Chatgpt(Chatgpt_4, StreamSimpleService, OpenAIStreamMixin): 'input': Decimal('0.0025'), # $5 / 1M tokens 'output': Decimal('0.015'), # $30 / 1M tokens 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), # 1 call 'generated_image': Decimal('10.2'), @@ -58,31 +58,31 @@ class Chatgpt(Chatgpt_4, StreamSimpleService, OpenAIStreamMixin): 'input': Decimal('0.0025'), # $5 / 1M tokens 'output': Decimal('0.015'), # $30 / 1M tokens 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), # 1 call 'generated_image': Decimal('10.2'), }, 'gpt-5.6-luna': { - 'input': Decimal('0.0005'), # $1 / 1M tokens - 'output': Decimal('0.003'), # $6 / 1M tokens + 'input': Decimal('0.0001'), # $0.2 / 1M tokens + 'output': Decimal('0.0006'), # $1.2 / 1M tokens 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), # 1 call 'generated_image': Decimal('10.2'), }, 'gpt-5.6-terra': { - 'input': Decimal('0.00125'), # $2.5 / 1M tokens - 'output': Decimal('0.0075'), # $15 / 1M tokens + 'input': Decimal('0.001'), # $2 / 1M tokens + 'output': Decimal('0.006'), # $12 / 1M tokens 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), # 1 call 'generated_image': Decimal('10.2'), @@ -493,7 +493,9 @@ class Chatgpt(Chatgpt_4, StreamSimpleService, OpenAIStreamMixin): Decimal(serper_sources * 250) / Decimal(2.7) * self.TOKENS_COST[model_name]['input'] ) if info.get('code_interpreter'): - json_data['tools'].append({'type': 'code_interpreter', 'container': {'type': 'auto'}}) + json_data['tools'].append( + {'type': 'code_interpreter', 'container': {'type': 'auto', 'memory_limit': '1g'}} + ) messages[-1]['content'] += ' the python tool ' predicted_input_price += self.TOKENS_COST[model_name]['code_interpreter'] if ctx['image']: @@ -67,18 +67,18 @@ class Chatgpt_4(SimpleService): 'input': Decimal('0.0003'), 'output': Decimal('0.0003'), 'web_search': { - 'low': Decimal('12.5'), # 1 call - 'medium': Decimal('13.75'), # 1 call - 'high': Decimal('15'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, }, 'gpt-4o': { 'input': Decimal('0.005'), 'output': Decimal('0.005'), 'web_search': { - 'low': Decimal('15'), # 1 call - 'medium': Decimal('17.5'), # 1 call - 'high': Decimal('25'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, }, 'gpt-oss-120b': {'input': Decimal('0.0002'), 'output': Decimal('0.0002')}, @@ -566,7 +566,7 @@ class Chatgpt_4(SimpleService): 'input': messages, 'tools': [ { - 'type': 'web_search_preview', + 'type': 'web_search', 'search_context_size': search_context_size, 'user_location': {'type': 'approximate', 'country': 'RU'}, } @@ -26,9 +26,9 @@ class Chatgpt_5(Chatgpt_4): 'input': Decimal('0.000625'), 'output': Decimal('0.005'), 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), }, @@ -36,9 +36,9 @@ class Chatgpt_5(Chatgpt_4): 'input': Decimal('0.000125'), 'output': Decimal('0.001'), 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), }, @@ -51,9 +51,9 @@ class Chatgpt_5(Chatgpt_4): 'input': Decimal('0.000625'), 'output': Decimal('0.005'), 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), # 1 call }, @@ -61,9 +61,9 @@ class Chatgpt_5(Chatgpt_4): 'input': Decimal('0.0075'), 'output': Decimal('0.06'), 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, }, 'gpt-5.1-codex-max': { @@ -82,9 +82,9 @@ class Chatgpt_5(Chatgpt_4): 'input': Decimal('0.000875'), 'output': Decimal('0.007'), 'web_search': { - 'low': Decimal('5'), # 1 call - 'medium': Decimal('5'), # 1 call - 'high': Decimal('5'), # 1 call + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), # 1 call }, @@ -239,7 +239,9 @@ class Chatgpt_5(Chatgpt_4): 'gpt-5', 'gpt-5.1', ): - json_data['tools'].append({'type': 'code_interpreter', 'container': {'type': 'auto'}}) + json_data['tools'].append( + {'type': 'code_interpreter', 'container': {'type': 'auto', 'memory_limit': '1g'}} + ) messages[-1]['content'] += 'the python tool' input_tokens, output_tokens, response = self.call_openai_api( proxy=proxy, endpoint='responses', json_data=json_data @@ -21,9 +21,9 @@ class Chatgpt_5_4(Chatgpt): 'input': Decimal('0.00125'), 'output': Decimal('0.0075'), 'web_search': { - 'low': Decimal('5'), - 'medium': Decimal('5'), - 'high': Decimal('5'), + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'code_interpreter': Decimal('15'), 'generated_image': Decimal('10.2'), @@ -32,9 +32,9 @@ class Chatgpt_5_4(Chatgpt): 'input': Decimal('0.0075'), 'output': Decimal('0.045'), 'web_search': { - 'low': Decimal('5'), - 'medium': Decimal('5'), - 'high': Decimal('5'), + 'low': Decimal('5'), # $0.01 / call + 'medium': Decimal('5'), # $0.01 / call + 'high': Decimal('5'), # $0.01 / call }, 'generated_image': Decimal('10.2'), }, @@ -227,7 +227,11 @@ class Claude(SerperMixin, StreamSimpleService): return memory def _build_callback_data(self, input_message: Message) -> dict[str, Any]: - return {'provider': {'order': ['anthropic']}, **input_message.info, 'tools': []} + return { + **input_message.info, + 'provider': {'order': ['anthropic'], 'allow_fallbacks': False}, + 'tools': [], + } def _prepare_messages( self, input_message: Message, version_slug: str, callback_data: dict @@ -26,12 +26,12 @@ class Deepseek(SimpleService): # 'output': Decimal('0'), # }, 'deepseek/deepseek-v4-pro': { - 'input': Decimal('1050') / 1_000_000, - 'output': Decimal('2200') / 1_000_000, + 'input': Decimal('261') / 1_000_000, # $0.87 / 1M tokens + 'output': Decimal('522') / 1_000_000, # $1.74 / 1M tokens }, - 'deepseek/deepseek-v4-flash': { - 'input': Decimal('100') / 1_000_000, - 'output': Decimal('175') / 1_000_000, + 'deepseek/deepseek-v4-flash-0731': { + 'input': Decimal('24') / 1_000_000, # $0.08 / 1M tokens + 'output': Decimal('75.6') / 1_000_000, # $0.252 / 1M tokens }, } @@ -62,6 +62,7 @@ class Deepseek(SimpleService): callback_data = { **info, + 'provider': {'order': ['digitalocean'], 'allow_fallbacks': False}, } messages = [ {'role': 'system', 'content': system_prompt}, @@ -99,8 +99,8 @@ class Gemini(SimpleService): raise ModelVersionNotAvailable(version_slug, self.TOKENS_COST) version = f'google/{version_slug}' callback_data = { - 'provider': {'order': ['Google AI Studio']}, **input_message.info, + 'provider': {'order': ['google-ai-studio'], 'allow_fallbacks': False}, } messages = self.get_chat_history() messages.append({'role': 'user', 'content': input_message.content}) @@ -79,8 +79,8 @@ class Gemini_3_1(StreamSimpleService): raise ModelVersionNotAvailable(version_slug, self.TOKENS_COST) model_slug = f'google/{version_slug}:online' callback_data = { - 'provider': {'order': ['Google AI Studio']}, **input_message.info, + 'provider': {'order': ['google-ai-studio'], 'allow_fallbacks': False}, } messages, embedding_tokens = self._prepare_messages(input_message) @@ -103,8 +103,8 @@ class Gemini_3_1(StreamSimpleService): raise ModelVersionNotAvailable(version_slug, self.TOKENS_COST) model_slug = f'google/{version_slug}:online' callback_data = { - 'provider': {'order': ['Google AI Studio']}, **input_message.info, + 'provider': {'order': ['google-ai-studio'], 'allow_fallbacks': False}, } messages, embedding_tokens = self._prepare_messages(input_message) input_tokens = output_tokens = 0 @@ -41,8 +41,8 @@ class Gemma(SimpleService): def make(self, input_message: Message, save: bool = True) -> list[Message]: callback_data = { - 'provider': {'order': ['DeepInfra']}, **input_message.info, + 'provider': {'order': ['deepinfra'], 'allow_fallbacks': False}, } messages = self.get_chat_history() messages.append({'role': 'user', 'content': input_message.content}) @@ -53,8 +53,8 @@ class Grok_4_1_Fast(SimpleService): def make(self, input_message: Message, save: bool = True) -> list[Message]: callback_data = { - 'provider': {'order': ['xAI']}, **input_message.info, + 'provider': {'order': ['xai'], 'allow_fallbacks': False}, } messages = self.get_chat_history() messages.append({'role': 'user', 'content': input_message.content}) @@ -66,7 +66,10 @@ class Llama(SimpleService): if version_slug is None or version_slug not in self.TOKENS_COST: raise ModelVersionNotAvailable(version_slug, self.TOKENS_COST) version = f'meta-llama/{version_slug}' - callback_data = {'provider': {'order': ['DeepInfra']}, **input_message.info} + callback_data = { + **input_message.info, + 'provider': {'order': ['deepinfra'], 'allow_fallbacks': False}, + } messages = self.get_chat_history() messages.append({'role': 'user', 'content': input_message.content}) image = input_message.file @@ -17,9 +17,9 @@ from payments.selectors.payment_plan_selector import PaymentPlanSelector class Ltx(SimpleService): TOKENS_COST = { - '1080p': Decimal('12'), - '2k': Decimal('24'), - '4k': Decimal('48'), + '1080p': Decimal('18'), # $0.06 / sec + '2k': Decimal('36'), # $0.12 / sec + '4k': Decimal('72'), # $0.24 / sec } @classmethod @@ -55,7 +55,10 @@ class Mistral(SimpleService): def make(self, input_message: Message, save: bool = True) -> list[Message]: version = 'mistralai/mistral-small-3.1-24b-instruct' - callback_data = {'provider': {'order': ['Parasail']}, **input_message.info} + callback_data = { + **input_message.info, + 'provider': {'order': ['parasail'], 'allow_fallbacks': False}, + } messages = self.get_chat_history() messages.append({'role': 'user', 'content': input_message.content}) image = input_message.file @@ -69,7 +69,10 @@ class Perplexity(SimpleService): if version_slug is None or version_slug not in self.TOKENS_COST: raise ModelVersionNotAvailable(version_slug, self.TOKENS_COST) version = f'perplexity/{version_slug}' - callback_data = {'provider': {'order': ['Perplexity']}, **input_message.info} + callback_data = { + **input_message.info, + 'provider': {'order': ['perplexity'], 'allow_fallbacks': False}, + } messages = self.get_chat_history() messages.append({'role': 'user', 'content': input_message.content}) try: @@ -54,7 +54,10 @@ class Qwen(SimpleService): if version_slug is None or version_slug not in self.TOKENS_COST: raise ModelVersionNotAvailable(version_slug, self.TOKENS_COST) version = f'qwen/{version_slug}' - callback_data = {'provider': {'order': ['DeepInfra']}, **input_message.info} + callback_data = { + **input_message.info, + 'provider': {'order': ['deepinfra'], 'allow_fallbacks': False}, + } messages = self.get_chat_history() messages.insert( 0, @@ -58,7 +58,10 @@ class Qwen_235B(SimpleService): if version_slug is None or version_slug not in self.TOKENS_COST: raise ModelVersionNotAvailable(version_slug, self.TOKENS_COST) version = f'qwen/{version_slug}' - callback_data = {'provider': {'order': ['DeepInfra']}, **input_message.info} + callback_data = { + **input_message.info, + 'provider': {'order': ['deepinfra'], 'allow_fallbacks': False}, + } messages = self.get_chat_history() messages.insert( 0, @@ -26,8 +26,8 @@ class Qwen_3_7(StreamSimpleService): COEFFICIENT = Decimal('300.0') TOKENS_COST = { - 'qwen3.7-max': {'input': Decimal('750'), 'output': Decimal('2250')}, - 'qwen3.7-plus': {'input': Decimal('120'), 'output': Decimal('480')}, + 'qwen3.7-max': {'input': Decimal('442.5'), 'output': Decimal('1327.5')}, # $1.475 / $4.425 + 'qwen3.7-plus': {'input': Decimal('96'), 'output': Decimal('384')}, # $0.32 / $1.28 } MAX_OUTPUT_TOKENS = 30_000 @@ -38,7 +38,10 @@ class Qwen_3_Max_Thinking(SimpleService): def make(self, input_message: Message, save: bool = True) -> list[Message]: start_time = time.time() - callback_data = {'provider': {'order': ['alibaba']}, **input_message.info} + callback_data = { + **input_message.info, + 'provider': {'order': ['alibaba'], 'allow_fallbacks': False}, + } messages = self.get_chat_history() messages.append({'role': 'user', 'content': input_message.content}) result = openrouter_run('qwen/qwen3-max-thinking:online', messages, callback_data, 'Qwen') @@ -20,12 +20,12 @@ from ml_model.tasks import bytedance_model_ark_run class Reve(SimpleService): # Reve временно не работает на репликейте. Временно используем сидрим - TEMPORARY_PROVIDER_MODEL = 'seedream-5-0-260128' + TEMPORARY_PROVIDER_MODEL = 'seedream-5-0-lite-260128' PRICE = { - '2K': Decimal('25'), - '3K': Decimal('50'), - '4K': Decimal('100'), + '2K': Decimal('17.5'), # $0.035 / image (seedream-5-0-lite-260128) + '3K': Decimal('17.5'), # $0.035 / image + '4K': Decimal('17.5'), # $0.035 / image } # PRICE = { # 'create': Decimal('12.5'), @@ -22,18 +22,18 @@ from payments.selectors.payment_plan_selector import PaymentPlanSelector class Seedream(SimpleService): TOKEN_COST = { 'seedream-boosted': { - '2K': Decimal('25'), - '3K': Decimal('50'), - '4K': Decimal('100'), + '2K': Decimal('17.5'), # $0.035 / image + '3K': Decimal('17.5'), # $0.035 / image + '4K': Decimal('17.5'), # $0.035 / image }, 'seedream-4.5': { - '2K': Decimal('25'), - '4K': Decimal('100'), + '2K': Decimal('20'), # $0.04 / image + '4K': Decimal('20'), # $0.04 / image }, } VERSION_MAPPING = { - 'seedream-boosted': 'seedream-5-0-260128', + 'seedream-boosted': 'seedream-5-0-lite-260128', 'seedream-4.5': 'seedream-4-5-251128', } @@ -3,4 +3,4 @@ from ml_model.services import Minimaxmusic class Suno(Minimaxmusic): - TOKENS_COST = Decimal('17.5') + TOKENS_COST = Decimal('15') # $0.03 * 100 * 5