Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
75 changes: 0 additions & 75 deletions fastdeploy/entrypoints/openai/api_server.py
Original file line number Diff line number Diff line change
Expand Up @@ -14,7 +14,6 @@
"""

import asyncio
import json
import os
import signal
import threading
Expand Down Expand Up @@ -80,7 +79,6 @@
StatefulSemaphore,
api_server_logger,
console_logger,
get_version_info,
is_port_available,
retrive_model_from_server,
)
Expand Down Expand Up @@ -783,79 +781,6 @@ async def metrics():
return Response(metrics_text, media_type="text/plain")


@metrics_app.get("/config-info")
@tracing.trace_span("config-info")
def config_info() -> Response:
"""
Get the current configuration of the API server.
"""
global llm_engine
if llm_engine is None:
return Response("Engine not loaded", status_code=500)
cfg = llm_engine.cfg

def process_object(obj):
if hasattr(obj, "__dict__"):
return obj.__dict__
if isinstance(obj, (set, frozenset)):
return list(obj)
return str(obj)

cfg_dict = {k: v for k, v in cfg.__dict__.items()}

# Version info
cfg_dict["version_info"] = get_version_info()

# Chat template
cfg_dict["chat_template"] = chat_template

# Server config from args
cfg_dict["server_config"] = {
"host": args.host,
"port": args.port,
"workers": args.workers,
"metrics_port": args.metrics_port,
"controller_port": args.controller_port,
"max_concurrency": args.max_concurrency,
"max_waiting_time": args.max_waiting_time,
"timeout": args.timeout,
"timeout_graceful_shutdown": args.timeout_graceful_shutdown,
"served_model_name": args.served_model_name,
"task": args.task,
"model_config_name": args.model_config_name,
"tokenizer_base_url": args.tokenizer_base_url,
"enable_mm_output": args.enable_mm_output,
"tool_call_parser": args.tool_call_parser,
"tool_parser_plugin": args.tool_parser_plugin,
}

# GPU info
try:
import paddle

from fastdeploy.platforms import current_platform

device_info = {}
device_info["device_type"] = current_platform.device_name
device_info["device_count"] = paddle.device.cuda.device_count()
device_ids = str(cfg.parallel_config.device_ids).split(",") if cfg.parallel_config else ["0"]
first_device = int(device_ids[0].strip()) - 1
props = paddle.device.cuda.get_device_properties(first_device)
device_info["device_name"] = props.name
device_info["device_total_memory"] = props.total_memory
device_info["device_multi_processor_count"] = props.multi_processor_count
device_info["device_major"] = props.major
device_info["device_minor"] = props.minor
cfg_dict["device_info"] = device_info
except Exception:
cfg_dict["device_info"] = None

env_dict = {k: v() for k, v in environment_variables.items()}
cfg_dict["env_config"] = env_dict
result_content = json.dumps(cfg_dict, default=process_object, ensure_ascii=False)
return Response(result_content, media_type="application/json")


def run_metrics_server():
"""
run metrics server
Expand Down
7 changes: 0 additions & 7 deletions tests/e2e/golang_router/test_ernie_03b_golang_router.py
Original file line number Diff line number Diff line change
Expand Up @@ -257,13 +257,6 @@ def headers():
return {"Content-Type": "application/json"}


def test_metrics_config(metrics_url):
timeout = 600
url = metrics_url.replace("metrics", "config-info")
res = requests.get(url, timeout=timeout)
assert res.status_code == 200


def send_request(url, payload, timeout=60):
"""
发送请求到指定的URL,并返回响应结果。
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -262,13 +262,6 @@ def headers():
return {"Content-Type": "application/json"}


def test_metrics_config(metrics_url):
timeout = 600
url = metrics_url.replace("metrics", "config-info")
res = requests.get(url, timeout=timeout)
assert res.status_code == 200


def send_request(url, payload, timeout=60):
"""
发送请求到指定的URL,并返回响应结果。
Expand Down
7 changes: 0 additions & 7 deletions tests/e2e/test_ernie_03b_pd_router_v1_ipc.py
Original file line number Diff line number Diff line change
Expand Up @@ -262,13 +262,6 @@ def headers():
return {"Content-Type": "application/json"}


def test_metrics_config(metrics_url):
timeout = 600
url = metrics_url.replace("metrics", "config-info")
res = requests.get(url, timeout=timeout)
assert res.status_code == 200


def send_request(url, payload, timeout=60):
"""
发送请求到指定的URL,并返回响应结果。
Expand Down
7 changes: 0 additions & 7 deletions tests/e2e/test_ernie_03b_pd_router_v1_rdma_global_cache.py
Original file line number Diff line number Diff line change
Expand Up @@ -373,13 +373,6 @@ def headers():
return {"Content-Type": "application/json"}


def test_metrics_config(metrics_url):
timeout = 600
url = metrics_url.replace("metrics", "config-info")
res = requests.get(url, timeout=timeout)
assert res.status_code == 200


def send_request(url, payload, timeout=60):
"""
发送请求到指定的URL,并返回响应结果。
Expand Down
7 changes: 0 additions & 7 deletions tests/e2e/test_ernie_03b_pd_router_v1_rdma_tp1.py
Original file line number Diff line number Diff line change
Expand Up @@ -266,13 +266,6 @@ def headers():
return {"Content-Type": "application/json"}


def test_metrics_config(metrics_url):
timeout = 600
url = metrics_url.replace("metrics", "config-info")
res = requests.get(url, timeout=timeout)
assert res.status_code == 200


def send_request(url, payload, timeout=60):
"""
发送请求到指定的URL,并返回响应结果。
Expand Down
7 changes: 0 additions & 7 deletions tests/e2e/test_ernie_03b_pd_router_v1_rdma_tp2.py
Original file line number Diff line number Diff line change
Expand Up @@ -270,13 +270,6 @@ def headers():
return {"Content-Type": "application/json"}


def test_metrics_config(metrics_url):
timeout = 600
url = metrics_url.replace("metrics", "config-info")
res = requests.get(url, timeout=timeout)
assert res.status_code == 200


def send_request(url, payload, timeout=60):
"""
发送请求到指定的URL,并返回响应结果。
Expand Down
7 changes: 0 additions & 7 deletions tests/e2e/test_ernie_03b_router.py
Original file line number Diff line number Diff line change
Expand Up @@ -265,13 +265,6 @@ def headers():
return {"Content-Type": "application/json"}


def test_metrics_config(metrics_url):
timeout = 600
url = metrics_url.replace("metrics", "config-info")
res = requests.get(url, timeout=timeout)
assert res.status_code == 200


def send_request(url, payload, timeout=60):
"""
发送请求到指定的URL,并返回响应结果。
Expand Down
8 changes: 0 additions & 8 deletions tests/entrypoints/openai/test_api_server.py
Original file line number Diff line number Diff line change
Expand Up @@ -819,14 +819,6 @@ def test_control_scheduler():
scheduler2.update_config.assert_not_called()


def test_config_info():
args = _build_args()
with _patch_common_imports(args):
api_server = _reload_api_server(args)
api_server.llm_engine = None
assert api_server.config_info().status_code == 500


# ── /v1/abort_requests ──────────────────────────────────────────────


Expand Down
Loading
Loading